编者按:《调查报道信息核实手册》(Verification Handbook for Investigative Reporting)是一本有关网络搜索和调查技巧的新鲜实用指南,指导人们如何利用UGC(user-generated content, 即用户生产的内容)和开源信息进行网络搜索和调查。此手册由总部设于荷兰的GIJN成员“欧洲新闻中心”(European Journalism Centre)出版,共有10章,均可免费下载。以下是该书第5章,由调查记者Giannina Segnini编写。
时至今日,记者们接触信息的渠道之多前所未有。现在世界上每天生成的数据有3 EB之多,相当于7亿5千万张DVD 的容量之和 (1EB = 1024TB = 1048576GB = 1073741824MB),而且这个数字每3年零4个月就能翻一番。
第一步就是对所有人和事物提出质疑。用数据一丝不苟地做新闻时,你会发现没有一个消息源是完全可靠的。
举个例子,问大家这样一个问题:你会完全信任世界银行发布的数据库吗?我问过的大多数记者都会回答“信任”;他们认为世界银行是可靠消息源。那就让我们验证这判断对不对。我选了两个世界银行的数据组来说明如何验证数据,并向各位强调:甚至所谓“可靠”的消息源也可能给出错误数据。我会沿下图所示的步骤带大家一探究竟:
在表格里只升序筛选“借出款项(Lending Project Cost)”这一数据,就能很快发现多条记录在这一列居然显示为零。
这就意味着如果项目花费显示为零的条目得不到合理解释,任何人在计算或分析每个国家、区域,或年份时引用相关项目支出数据就可能出错,这样的数据集就会导向错误结论。
世界银行发布了另一个数据库,涵盖了1947年以来它所资助的每个项目的单独数据(不仅仅是估算数据),如下图所示:
如下图,在Excel里打开名为 api.csv 的文件(2014年12月7日的版本),你就会一目了然:数据混杂,一格里包含很多变量(例如领域名称或国家名称)。但更值得注意的是:文件并没有涵盖所有1947以来的投资项目。
实际上,数据库只收录了1947年以来世界银行15000多个项目中的6352个。(注:世银最终纠正了错误。到2015年2月12日为止,这份文件共收集16215条记录。)
我在波多黎各开工作坊期间,发现了另一个数据库不够连贯的例子。 我们从审计官的办公室调用了政府合同数据库。去年全部的合同中,有72份政府合同在花费记录上出现了负值($–10,000,000)。
第二张图显示的是你可以用数据库里的数值范围生成一个柱状图,在表格中移动箭头筛选数值。可用同样的方法筛选日期和文本数值。
是否有重复记录?
我们犯的一个普遍错误是处理数据时没辨识出重复记录。
处理涉及人、公司、活动或交易的分类数据或信息时,首先搜索每条信息的唯一识别项。以世界银行的项目评估数据库为例,每个项目都包含一个唯一编码,或者“项目ID”,以供识别。其他机构的数据库可能有唯一识别码,或者像政府合同数据库那样,有一个合同编码。
这种情况下,重复记录的产生是由于每一条记录都用了多重评估类型,我们必须选择最值得信赖的评估方式。(在这个例子中,“表现评估报告” [PARs]似乎是最可信的数据,它们让评估更有说服力。该数据由独立评估小组(Independent Evaluation Group )开发,它每年独立、随机选取了世界银行25%的项目做抽样调查,派专家实地评估项目结果,发布独立评估报告。)
数据准确吗?
世界银行的数据库按理应该收录了该机构所发起的所有项目,如果我们按每项花费的降序排列这些项目,会发现印度有一个项目花费最多,总额高达298.333亿美元 (相当于人民币1852亿元)。
如果我们在谷歌上搜索项目号(P144447),我们就能看到项目和其拨款的原版批准文件,清楚写着298.33亿美元的花费。这说明数字是准确的。
核实数据的完整性
例如,在世界银行的数据库里,还有不少多年前就得到批准的项目依然在“活跃”之列,即使很多项目已经结束了。
为了验证,我创建了一个数据透视表,把每年批准通过的项目分组。接着筛选数据,只显示那些在“状态”一列是“进行中(Active)”的项目。我们发现1986、87和89年审批通过的17个项目在数据库里依然显示为“进行中”。他们几乎都在非洲。
我们应该使用其他的测试来检测世界银行数据的一致性。例如,检查贷款接收方(在数据库里显示的时“借款人”(borrowers))和(或)“国家名称”(Countryname)标注的国家组织与实际政府是否一一对应。或者看看这些国家分属的区域是否正确(查“区域名称”(regionname)一列)。
破解编码和缩略词
吓跑记者的最好方法之一是给他/她充斥特殊编码和术语的复杂信息,这是希望隐瞒信息的官员和组织偏爱的伎俩。他们希望我们从公开信息里看不出个所以然。但编码和缩略词也有好处:可以减少用词量,扩充信息容量。几乎所有数据系统,不论公共还是私人,都用编码和缩略词来分类信息。
世界上很多人、机构和事物都有一个或数个专属编码。人们拥有身份证号、社保号码、银行客户编号,纳税人识别号,学号,雇员编号等。
因此我们必须学习如何破解编码,理解他们是怎么被用来表达数据库背后的逻辑,更重要的是,理解他们之间的关系。
全世界有1700万个货物集装箱,每一个都有一条唯一识别码,我们如果知道识别码开头的四个字母和物主的身份相关,就能依此追踪集装箱的去向。在这个数据库里,你可以查询物主信息。一条神秘编码的四个字母,就已经打开了获取更多信息的大门。
在世界银行记录评估项目的数据库里,编码和缩略词比比皆是,而令人惊奇的是,机构并没有发布统一的词汇表阐述编码的含义。一些缩略词甚至已经过时,仅在旧文件里出现。
例如在“资金调度工具(Lending Instrument)”这一栏,根据世界银行资助项目的16种信贷工具类型,把所有的项目分类:APL, DPL, DRL, ERL, FIL, LIL, NA, PRC, PSL, RIL, SAD, SAL, SIL, SIM, SSL 和TAL 。为了理解数据,有必要弄清楚这些缩略词的意思。否则你还不知道“ERL”指的是紧急贷款,专门贷给刚经历武装冲突或者自然灾害的国家。
编码SAD, SAL, SSL 和PSL和上世纪80、90年代世界银行争议颇多的“结构调整项目(Structural Adjustment Program)”有关。该项目贷款给身陷经济危机的国家,作为交换,这些国家调整经济政策,以削减财政赤字。(由于在好几个国家造成的社会影响,这个项目受到诸多质疑。)
世界银行称,自上世纪90年代末,他们更重视以“发展”为目标的贷款,而不那么重视那些旨在“调整”的了。但是,数据库显示,在2001年和2006年之间,150多笔批准的贷款标示的是“结构调整编码”。
这是数据库的错误?还是结构调整项目2000年之后仍在继续?
这个例子告诉我们:破解缩略词不仅是评估数据,更重要的是能发现公众关心的故事。
这个故事浓缩了我在数据调查里学到的最有效的经验:即使最好的数据分析也不能代替现场新闻和实地核查。