中文

EDNA-Covid:使用 EDNA 流式工具包收集的大规模 Covid-19 推文数据集

社会与信息网络 2020-10-22 v2

摘要

Covid-19 大流行从根本上改变了我们生活的许多方面。随着全国范围内的封锁和居家建议,关于大流行的讨论自然转移到了社交网络(如 Twitter)上。这为在存在长期破坏性因素(如大流行)的情况下,借助高容量、高速度、高噪声的 Covid-19 Twitter 信息流来洞察社会话语的演变提供了前所未有的视角。然而,从这样的数据流中提取实时信息需要容错的流处理基础设施,以执行来自新闻机构、社交信息流以及权威医疗机构(如 CDC)的异构数据源的非平凡整合。为了解决这个问题,我们提出了(i)用于消费和处理流数据的 EDNA 流处理工具包,以及(ii)自 2020 年 1 月 25 日以来使用 EDNA 收集的与冠状病毒相关的多语言大规模推文数据集 EDNA-Covid。截至本文发表时,EDNA-Covid 包含了来自世界各地、超过 10 种语言的超过 6 亿条推文。我们将 EDNA 工具包和 EDNA-Covid 数据集向公众发布,以便它们可用于提取关于这一非凡社会事件的宝贵见解。

关键词

引用

@article{arxiv.2010.04084,
  title  = {EDNA-Covid: A Large-Scale Covid-19 Tweets Dataset Collected with the EDNA Streaming Toolkit},
  author = {Abhijit Suprem and Calton Pu},
  journal= {arXiv preprint arXiv:2010.04084},
  year   = {2020}
}