何时存在偏差?评估Twitter Streaming API的代表性
社会与信息网络
2014-01-31 v1 物理与社会
摘要
Twitter不仅因其庞大的用户群和内容,还因其在数据共享方面的开放性而引起了科学界的兴趣。Twitter通过“Streaming API”分享其推文的免费1%样本,该服务根据研究人员设置的参数返回推文样本。最近,研究指出了Streaming API返回数据中存在偏差的证据,引发了对此数据服务在研究场景中完整性的担忧。虽然这些结果很重要,但先前工作中提出的方法依赖于限制性强且昂贵的Firehose来发现Streaming API数据中的偏差。在这项工作中,我们解决了在没有“黄金标准”Firehose数据的情况下寻找样本偏差的问题。具体而言,我们专注于在Streaming API数据中寻找那些标签趋势与Twitter真实活动趋势显著不同的时间段。我们提出了一种解决方案,利用开放数据源来发现Streaming API中的偏差。最后,我们评估了该数据源在稀疏数据情况以及从不同区域发出相同查询的用户中的实用性。
引用
@article{arxiv.1401.7909,
title = {When is it Biased? Assessing the Representativeness of Twitter's Streaming API},
author = {Fred Morstatter and Jürgen Pfeffer and Huan Liu},
journal= {arXiv preprint arXiv:1401.7909},
year = {2014}
}