中文

具有主题模型预处理的结构树:一种以维基解密阿富汗战争日志为例的数据新闻方法

应用统计 2013-12-06 v1

摘要

维基解密阿富汗战争日志包含了近 77,00077,000 份关于美国领导的阿富汗战争事件的报告,涵盖时间为 2004 年 1 月至 2009 年 12 月。复杂社会系统数据的增长及其衍生故事的潜力,已将新闻界和科学界的关注点日益转向数据驱动新闻和计算社会科学。在本文中,我们主张将现代统计方法用于数据新闻及其他领域的问题,这可能有助于新闻和科研工作并带来额外的见解。以维基解密阿富汗战争日志为例,我们提出了一种为数据中可解释的片段构建可理解统计模型的方法,在本例中用于探索与阿富汗战争中不同情况相关的死亡率。我们的方法结合了潜在狄利克雷分配 (LDA) 预处理与结构树 (model trees)。LDA 用于通过估计潜在主题并将每份报告分配给其中一个主题,来处理每份报告摘要中包含的自然语言信息。这些主题分配与其他变量一起作为分割变量,用于寻找数据中的片段,并对这些片段拟合关于报告死亡人数的局部统计模型。分割和拟合是通过对负二项分布进行递归划分来完成的。我们识别出具有不同死亡率的片段,这些片段对应于少量主题和其他变量及其相互作用。此外,我们提炼出片段之间的相似性,并将它们与媒体已报道的故事联系起来。这提供了对阿富汗战争前所未有的描述,并作为一个范例,展示了数据新闻、计算社会科学以及其他关注数据库数据的领域如何从现代统计技术中受益。

关键词

引用

@article{arxiv.1312.1548,
  title  = {Model trees with topic model preprocessing: An approach for data journalism illustrated with the WikiLeaks Afghanistan war logs},
  author = {Thomas Rusch and Paul Hofmarcher and Reinhold Hatzinger and Kurt Hornik},
  journal= {arXiv preprint arXiv:1312.1548},
  year   = {2013}
}

备注

Published in at http://dx.doi.org/10.1214/12-AOAS618 the Annals of Applied Statistics (http://www.imstat.org/aoas/) by the Institute of Mathematical Statistics (http://www.imstat.org)