对抗信息疫情:COVID-19假新闻数据集
计算与语言
2021-05-27 v4 信息检索
社会与信息网络
摘要
与COVID-19大流行同时,我们也在对抗一场“信息疫情”(infodemic)。社交媒体上假新闻和谣言猖獗。相信谣言会造成重大危害。在疫情期间这一点进一步加剧。为此,我们整理并发布了一个人工标注的数据集,包含10,700条关于COVID-19真实与假新闻的社交媒体帖子和文章。我们用四种机器学习基线方法——决策树、逻辑回归、梯度提升和支持向量机(SVM)——对该标注数据集进行基准测试。我们使用SVM获得了93.46% F1分数的最佳性能。数据和代码可在以下地址获取:https://github.com/parthpatwa/covid19-fake-news-dectection
引用
@article{arxiv.2011.03327,
title = {Fighting an Infodemic: COVID-19 Fake News Dataset},
author = {Parth Patwa and Shivam Sharma and Srinivas Pykl and Vineeth Guptha and Gitanjali Kumari and Md Shad Akhtar and Asif Ekbal and Amitava Das and Tanmoy Chakraborty},
journal= {arXiv preprint arXiv:2011.03327},
year = {2021}
}
备注
Published at CONSTRAINT-2021, Collocated with AAAI-2021