中文

Twitter数据抽样如何偏倚美国选民行为刻画

计算机与社会 2020-06-03 v1 社会与信息网络

摘要

在线社交媒体是公众讨论政治议题的关键平台。因此,研究人员利用这些平台的数据来分析舆论并预测选举结果。近期研究揭示了恶意社交机器人和水军等不真实行为体的存在,表明并非每条消息都来自合法用户的真实表达。然而,社交数据流中不真实活动的普遍程度仍不明确,使得基于此类数据的分析偏倚难以评估。本文旨在利用2018年美国中期选举的Twitter数据弥补这一空白。在按体量抽样中,过度活跃账户被过度代表。我们使用一种快速低成本的启发式方法,将其特征与随机抽样账户及自我标识的选民进行比较。结果表明,与可能选民相比,过度活跃账户更可能表现出多种可疑行为并分享低可信度信息。随机账户与可能选民更为相似,尽管其表现出可疑行为的概率略高。我们的工作揭示了使用在线观测刻画选民时存在的偏倚,强调了在基于社交媒体数据的政治议题研究中考虑不真实行为体的重要性。

关键词

引用

@article{arxiv.2006.01447,
  title  = {How Twitter Data Sampling Biases U.S. Voter Behavior Characterizations},
  author = {Kai-Cheng Yang and Pik-Mai Hui and Filippo Menczer},
  journal= {arXiv preprint arXiv:2006.01447},
  year   = {2020}
}

备注

19 pages, 13 figures