中文

Mega-COV:用于 COVID-19 研究的涵盖 100 多种语言的十亿级数据集

社会与信息网络 2021-02-09 v4 计算与语言

摘要

我们描述了 Mega-COV,一个来自 Twitter 的十亿级 COVID-19 研究数据集。该数据集具有多样性(覆盖 268 个国家)、纵向性(可追溯至 2007 年)、多语言性(含 100 多种语言),并包含大量带位置标签的推文(约 1.69 亿条)。我们发布了该数据集的推文 ID。我们还开发并发布了两个强大模型,一个用于识别推文是否与疫情相关(最佳 F1=97%),另一个用于检测关于 COVID-19 的虚假信息(最佳 F1=92%)。一项人工标注研究揭示了我们的模型在 Mega-COV 子集上的效用。我们的数据和模型可用于研究与疫情相关的广泛现象。Mega-COV 及我们的模型均已公开可用。

关键词

引用

@article{arxiv.2005.06012,
  title  = {Mega-COV: A Billion-Scale Dataset of 100+ Languages for COVID-19},
  author = {Muhammad Abdul-Mageed and AbdelRahim Elmadany and El Moatez Billah Nagoudi and Dinesh Pabbi and Kunal Verma and Rannie Lin},
  journal= {arXiv preprint arXiv:2005.06012},
  year   = {2021}
}