中文

CML-COVID:一个带有潜在主题、情感与位置信息的大规模 COVID-19 Twitter 数据集

社会与信息网络 2021-01-29 v1 计算机与社会 人机交互

摘要

作为一个平台,Twitter 已成为与 COVID-19 大流行相关讨论的重要公共空间。Twitter 等公共社交媒体平台代表了关于该大流行的重要参与场所,这些数据可被研究团队用于社会、健康及其他研究。理解公众对 COVID-19 的看法以及信息在社交媒体中的扩散方式,对政府和科研机构十分重要。Twitter 是一个无处不在的公共平台,因此在理解公众对 COVID-19 的感知、行为与态度方面具有巨大效用。在本研究中,我们呈现 CML-COVID,一个包含来自 5,977,653 位独立用户的 19,298,967 百万条推文的 COVID-19 Twitter 数据集,并总结这些数据的部分属性。这些推文于 2020 年 3 月至 2020 年 7 月间使用与 COVID-19 相关的查询词 coronavirus、covid 与 mask 收集。我们利用主题建模、情感分析与描述性统计来描述所收集的 COVID-19 相关推文及可用的推文地理位置。我们提供了如何访问我们的推文数据集(使用 twarc 归档)的信息。

关键词

引用

@article{arxiv.2101.12202,
  title  = {CML-COVID: A Large-Scale COVID-19 Twitter Dataset with Latent Topics, Sentiment and Location Information},
  author = {Hassan Dashtian and Dhiraj Murthy},
  journal= {arXiv preprint arXiv:2101.12202},
  year   = {2021}
}

备注

6 pages, 4 figures, and 3 tables