中文

EPIC30M:包含超 3000 万相关推文的新冠与历史疫情语料库

社会与信息网络 2020-06-23 v2 计算与语言 计算机与社会

摘要

自 COVID-19 开始以来,文献中呈现了若干来自不同来源、包含数百万数据点的相关语料库。尽管这些语料库对支持针对该特定疫情的多项分析很有价值,研究者仍需要包含其他疫情、以促进跨疫情模式识别与趋势分析任务的额外基准语料库。在我们其他 COVID-19 相关工作中,我们发现文献中极少有规模与丰富度足以支持此类跨疫情分析的疾病相关语料库。本文呈现 EPIC30M,一个包含 2006 至 2020 年从 Twitter 爬取的 3000 万条微博帖子(即推文)的大规模疫情语料库。EPIC30M 包含 2620 万条与三种一般疾病相关的推文子集,即埃博拉、霍乱与猪流感,以及另一包含 470 万条六次全球疫情爆发的推文子集,包括 2009 H1N1 猪流感、2010 海地霍乱、2012 中东呼吸综合征(MERS)、2013 西非埃博拉、2016 也门霍乱与 2018 基伍埃博拉。此外,我们通过各子集关键术语与标签统计及趋势分析探讨并讨论该语料库属性。最后,我们通过讨论近年来日益受关注的多个跨疫情研究主题用例,展示 EPIC30M 可创造的价值与影响。这些用例跨越多个研究领域,如流行病学建模、模式识别、自然语言理解与经济学建模。

关键词

引用

@article{arxiv.2006.08369,
  title  = {EPIC30M: An Epidemics Corpus Of Over 30 Million Relevant Tweets},
  author = {Junhua Liu and Trisha Singhal and Lucienne T. M. Blessing and Kristin L. Wood and Kwan Hui Lim},
  journal= {arXiv preprint arXiv:2006.08369},
  year   = {2020}
}