该样本似乎已足够好!评估 Twitter 学术 API 的覆盖度与时间可靠性
社会与信息网络
2023-04-12 v3
摘要
由于愿意与学术界和工业界共享数据,在过去十年中,Twitter 一直是科学研究以及企业与政府咨询的主要社交媒体平台。近年来,一系列出版物研究并批评了 Twitter 的 API,Twitter 也部分调整了其现有数据流。最新的 Twitter 学术研究 API 允许“访问 Twitter 的实时和历史公开数据,并具备额外功能以支持收集更精确、完整和无偏的数据集”。该 API 的主要新特性是可访问所有历史推文的完整档案。在本文中,我们将仔细审视学术 API 并尝试回答两个问题。第一,使用学术 API 收集的数据集是否完整?第二,由于 Twitter 学术 API 交付的历史推文为数据收集时 Twitter 上的呈现形式,我们需要理解随着时间推移因推文与账号从平台移除而丢失的数据量。我们的工作表明,Twitter 学术 API 确实可以基于多种搜索词创建(近乎)完整的 Twitter 数据样本。我们还提供证据表明 Twitter 的数据端点 v2 比先前使用的端点 v1.1 提供更好的样本。此外,在研究某一现象时通过学术 API 收集推文,而非创建存储推文的本地档案,可简便地遵循 Twitter 开发者协议。最后,我们亦讨论学术 API 的技术缺陷与影响。我们希望本研究能增进对 Twitter 数据收集的理解,从而通过社交媒体数据开展更可靠的人类行为研究。
引用
@article{arxiv.2204.02290,
title = {This Sample seems to be good enough! Assessing Coverage and Temporal Reliability of Twitter's Academic API},
author = {Juergen Pfeffer and Angelina Mooseder and Jana Lasser and Luca Hammer and Oliver Stritzel and David Garcia},
journal= {arXiv preprint arXiv:2204.02290},
year = {2023}
}