中文

用于开放科学研究的大规模 COVID-19 Twitter 聊天数据集——一项国际合作

社会与信息网络 2021-08-10 v2 信息检索

摘要

随着 COVID-19 大流行在全球持续蔓延,正在产生前所未有的开放数据用于遗传学和流行病学研究。世界各地许多研究小组以空前的速度发布关于这场持续大流行的数据和出版物,使其他科学家能够从 COVID-19 大流行前线的本地经验和生成的数据中学习。然而,有必要整合额外的数据源,将这一独特全球事件的社会动态作用映射并度量后纳入生物医学、生物学和流行病学分析。为此,我们提供了一个大规模精选数据集,包含超过 1.52 亿条推文,且每日增长,涉及截至撰写时从 1 月 1 日至 4 月 4 日生成的 COVID-19 聊天内容。该开放数据集将允许研究人员开展多项研究项目,涉及对社交距离措施的情绪与心理反应、错误信息来源的识别,以及近乎实时地对大流行情绪的分层度量。

关键词

引用

@article{arxiv.2004.03688,
  title  = {A large-scale COVID-19 Twitter chatter dataset for open scientific research -- an international collaboration},
  author = {Juan M. Banda and Ramya Tekumalla and Guanyu Wang and Jingyuan Yu and Tuo Liu and Yuning Ding and Katya Artemova and Elena Tutubalina and Gerardo Chowell},
  journal= {arXiv preprint arXiv:2004.03688},
  year   = {2021}
}

备注

8 pages, 1 figure 2 table. Update: new version of paper with up-to-date statistics and new co-authors