中文

VoterFraud2020:Twitter 上选举欺诈声明的多模态数据集

社会与信息网络 2021-04-28 v2

摘要

围绕美国 2020 年大选广泛传播的毫无根据的选举欺诈声明,已导致对选举信任的削弱,并最终在美国国会大厦内引发暴力事件。在此情形下,理解 Twitter(声明传播的主要平台)上围绕这些声明的讨论至关重要。为此,我们收集并发布了 VoterFraud2020 数据集,这是一个包含 260 万用户发布的 760 万条推文和 2560 万次转推、与选民欺诈声明相关的多模态数据集。为使该数据能立即用于多样化的研究项目,我们进一步利用从转推图计算的簇标签、各用户的封禁状态以及推文中图像的感知哈希来增强数据。该数据集还包含推文中出现的所有外部链接和 YouTube 视频的聚合数据。对数据的初步分析表明,Twitter 的用户封禁行动主要影响了特定的选民欺诈声明传播者社群,并揭示了数据中最常被分享的 URL、图像和 YouTube 视频。

关键词

引用

@article{arxiv.2101.08210,
  title  = {VoterFraud2020: a Multi-modal Dataset of Election Fraud Claims on Twitter},
  author = {Anton Abilov and Yiqing Hua and Hana Matatov and Ofra Amir and Mor Naaman},
  journal= {arXiv preprint arXiv:2101.08210},
  year   = {2021}
}

备注

12 pages, 5 figures. See http://voterfraud2020.io