Checkovid:基于网络与内容挖掘视角的Twitter COVID-19 misinformation检测系统
机器学习
2021-07-22 v1 计算与语言
社会与信息网络
摘要
在COVID-19大流行期间,由于社会隔离和 quarantine,社交媒体平台成为理想的沟通渠道。同时,它也是大规模 misinformation 传播的主要来源,被称为信息疫情(infodemic)。因此,自动辟谣是一项关键问题。为应对该问题,我们提出了两个Twitter上COVID-19相关的misinformation数据集,并提出了一种基于机器学习算法和NLP技术的misinformation检测系统,包含基于网络和基于内容的处理流程。在基于网络的处理中,我们关注社会属性、网络特征和用户。另一方面,在基于内容的处理中,我们直接使用推文内容分类misinformation,其中包含文本分类模型(段落级和句子级)和相似度模型。基于网络处理的评估结果显示人工神经网络模型取得最佳结果,F1值为88.68%。在基于内容的处理中,我们新颖的相似度模型取得了90.26%的F1值,相较于基于网络的模型在misinformation分类结果上有所提升。此外,在文本分类模型中,使用stacking集成学习模型取得了最佳结果,F1值为95.18%。进一步地,我们在Constraint@AAAI2021数据集上测试了基于内容的模型,取得94.38%的F1值,改进了基线结果。最后,我们开发了一个名为Checkovid的事实核查网站,利用上述各处理流程从不同视角检测COVID-19领域中的misinformative和informative声明。
引用
@article{arxiv.2107.09768,
title = {Checkovid: A COVID-19 misinformation detection system on Twitter using network and content mining perspectives},
author = {Sajad Dadgar and Mehdi Ghatee},
journal= {arXiv preprint arXiv:2107.09768},
year = {2021}
}
备注
20 Pages, 18 Figures, 7 Tables, Submitted for Review Process in a Journal