Twitter数据集持久性的纵向评估
数字图书馆
2018-03-08 v2
摘要
随着社交媒体数据集越来越多地被研究人员共享,这也带来了一个警示,即这些数据集并不总是完全可复现的。由于必须遵守Twitter等平台的要求,研究人员不能发布原始数据,而必须发布一个唯一标识符列表,其他人随后可以使用这些标识符从平台自行重新收集数据。这导致了一个问题,即数据的子集可能不再可用,因为内容可以被删除或用户账户可以被停用。为了量化内容删除对数据集长期可复现性的影响,我们对30个Twitter数据集进行了持久性的纵向分析,这些数据集包含超过1.47亿条推文。我们拥有2012年至2016年间收集的原始数据集,并在之后通过使用推文ID重新收集它们,考察了四个不同的因素来量化重新收集的数据集与原始数据集的相似程度:完整性、代表性、相似性和变化性。尽管随着数据集变旧,可用推文的比例不断下降,但我们发现重新收集的子集的文本内容仍然在很大程度上代表了最初收集的整个数据集。然而,元数据的代表性随着时间的推移不断下降,这既是因为数据集缩小,也是因为某些元数据(如用户的关注者数量)不断变化。我们的研究对研究人员在其研究中共享和使用公开共享的Twitter数据集具有重要意义。
引用
@article{arxiv.1709.09186,
title = {A Longitudinal Assessment of the Persistence of Twitter Datasets},
author = {Arkaitz Zubiaga},
journal= {arXiv preprint arXiv:1709.09186},
year = {2018}
}
备注
Accepted for publication in JASIST