FakeCovid——一个面向 COVID-19 的多语言跨领域事实核查新闻数据集
计算机与社会
2020-06-23 v1 社会与信息网络
摘要
本文提出首个针对 COVID-19 的多语言跨领域事实核查新闻数据集,包含 5182 篇事实核查文章,收集时间为 2020 年 1 月 4 日至 2020 年 5 月 15 日。我们在从 Poynter 和 Snopes 获取参考文献后,从 92 个不同事实核查网站收集了事实核查文章。我们根据内容将文章手动标注为 11 种不同的事实核查新闻类别。该数据集涵盖来自 105 个国家的 40 种语言。我们构建了一个分类器来检测假新闻,并给出了自动假新闻检测及其类别的结果。我们的模型在检测虚假类与其他事实核查文章上取得了 0.76 的 F1 分数。FakeCovid 数据集已在 Github 上提供。
引用
@article{arxiv.2006.11343,
title = {FakeCovid -- A Multilingual Cross-domain Fact Check News Dataset for COVID-19},
author = {Gautam Kishore Shahi and Durgesh Nandini},
journal= {arXiv preprint arXiv:2006.11343},
year = {2020}
}
备注
CySoc 2020 International Workshop on Cyber Social Threats, ICWSM 2020