中文

COVID-19 信息疫情:基于机器学习方法理解假新闻检测中的内容特征

计算与语言 2026-05-11 v1 人工智能 机器学习

摘要

尽管经验证据表明内容特征(特别是文本和语言特征)有助于区分真实新闻与假新闻,但其在假新闻检测中的应用研究尚不充分。为此,本研究考察了词二元语法、词性分布等一系列内容特征,以提升假新闻检测效果。我们在 COVID-19 期间收集的新数据集上进行了一系列实验,使用了决策树、K 近邻、逻辑回归、支持向量机和随机森林。在所有设置中,随机森林产生了最佳结果,紧随其后的是支持向量机。总体而言,发现文本和语言特征在单独使用时均能改善假新闻检测,然而,将它们组合成单一模型并未显著提升检测效果。二元语法和词性标签的使用之间也存在差异。研究表明,与传统深度学习不同,利用传统机器学习方法可以成功地将文本和语言特征用于检测假新闻。

关键词

引用

@article{arxiv.2605.06435,
  title  = {COVID-19 Infodemic. Understanding content features in detecting fake news using a machine learning approach},
  author = {Vimala Balakrishnan and Lee Zing Hii and Eric Laporte},
  journal= {arXiv preprint arXiv:2605.06435},
  year   = {2026}
}