中文

基于机器学习的 COVID-19 假新闻自动标注与检测

社会与信息网络 2022-09-08 v1 计算机与社会 机器学习

摘要

COVID-19 影响了世界的每一个角落,尽管有关该疫情的错误信息传播速度比病毒本身还要快。通过在线社交网络(OSN)传播的错误信息常常误导人们不遵循正确的医疗实践。特别是,OSN 机器人一直是散布虚假信息和发起网络宣传的主要来源。现有工作忽视了作为传播催化剂的机器人的存在,并且侧重于“帖子中分享的文章”中的假新闻检测,而非帖子(文本)内容。大多数错误信息检测工作使用人工标注的数据集,难以扩展以构建其预测模型。在本研究中,我们通过提出一种利用 Twitter 数据集上经核实的事实核查声明来自动标注数据的方法,克服了数据稀缺这一挑战。此外,我们将文本特征与用户级特征(如粉丝数和好友数)以及推文级特征(如推文中提及数、标签数和 URL 数)相结合,作为检测错误信息的附加指标。而且,我们分析了推文中机器人的存在,表明机器人会随时间改变其行为,并在错误信息传播活动期间最为活跃。我们收集了 1022 万条 COVID-19 相关推文,并使用我们的标注模型构建了一个广泛且原创的基准真值数据集用于分类。我们利用多种机器学习模型来准确检测错误信息,我们的最佳分类模型达到了精确率(82%)、召回率(96%)和假阳性率(3.58%)。此外,我们的机器人分析表明,机器人生成了约 10% 的错误信息推文。我们的方法大幅暴露了虚假信息,从而提升了通过社交媒体平台传播信息的可信度。

关键词

引用

@article{arxiv.2209.03162,
  title  = {Machine Learning-based Automatic Annotation and Detection of COVID-19 Fake News},
  author = {Mohammad Majid Akhtar and Bibhas Sharma and Ishan Karunanayake and Rahat Masood and Muhammad Ikram and Salil S. Kanhere},
  journal= {arXiv preprint arXiv:2209.03162},
  year   = {2022}
}