中文

FakeCovid——一个面向 COVID-19 的多语言跨领域事实核查新闻数据集

计算机与社会 2020-06-23 v1 社会与信息网络

摘要

本文提出首个针对 COVID-19 的多语言跨领域事实核查新闻数据集,包含 5182 篇事实核查文章,收集时间为 2020 年 1 月 4 日至 2020 年 5 月 15 日。我们在从 Poynter 和 Snopes 获取参考文献后,从 92 个不同事实核查网站收集了事实核查文章。我们根据内容将文章手动标注为 11 种不同的事实核查新闻类别。该数据集涵盖来自 105 个国家的 40 种语言。我们构建了一个分类器来检测假新闻,并给出了自动假新闻检测及其类别的结果。我们的模型在检测虚假类与其他事实核查文章上取得了 0.76 的 F1 分数。FakeCovid 数据集已在 Github 上提供。

关键词

引用

@article{arxiv.2006.11343,
  title  = {FakeCovid -- A Multilingual Cross-domain Fact Check News Dataset for COVID-19},
  author = {Gautam Kishore Shahi and Durgesh Nandini},
  journal= {arXiv preprint arXiv:2006.11343},
  year   = {2020}
}

备注

CySoc 2020 International Workshop on Cyber Social Threats, ICWSM 2020