中文

购者自慎:计算社会科学——广泛使用的 Reddit 语料库中的大规模缺失数据

社会与信息网络 2018-09-05 v1

摘要

随着研究者使用计算方法大规模研究复杂社会行为,这种计算社会科学的效度取决于数据的完整性。2015 年 7 月 2 日,Jason Baumgartner 发布了一个声称包含“每一条公开可用的 Reddit 评论”的数据集,该数据集很快通过 Bittorrent 与 Internet Archive 传播。该数据迅速成为许多学术论文的基础,主题涵盖机器学习、社会行为、政治、突发新闻与仇恨言论。我们发现该数据集中存在显著缺口与局限,可能导致相关研究的偏差。本文中,我们记录了该数据集、数据集中大量缺失的观测值,以及这些缺口对研究效度带来的风险。总之,我们识别出:对考虑用户历史或网络分析的研究存在高风险,对比较参与计数的研究存在中等风险,而对避免对 Reddit 上的行为与参与做出代表性断言的机器学习研究风险较小。

关键词

引用

@article{arxiv.1803.05046,
  title  = {Caveat Emptor, Computational Social Science: Large-Scale Missing Data in a Widely-Published Reddit Corpus},
  author = {Devin Gaffney and J. Nathan Matias},
  journal= {arXiv preprint arXiv:1803.05046},
  year   = {2018}
}