面向在线假新闻检测的机器学习模型基准研究
计算与语言
2021-04-14 v2 信息检索
机器学习
机器学习
摘要
假新闻的泛滥及其在社交媒体上的传播因其能造成破坏性影响而成为一个主要问题。已有不同的机器学习方法被提出以检测假新闻。然而,其中大多数聚焦于特定类型的新闻(如政治类),这使我们质疑所用模型的数据集偏差。在本研究中,我们开展了一项基准研究,在三个不同数据集上评估多种适用机器学习方法的性能,其中我们收集了最大且最具多样性的一个数据集。我们探索了若干先进的预训练语言模型用于假新闻检测,连同传统和深度学习方法,并在我们所知范围内首次从不同方面比较了它们的性能。我们发现 BERT 及类似预训练模型在假新闻检测上表现最佳,尤其在极小规模数据集下。因此,这些模型对于电子内容有限(即训练数据有限)的语言是明显更优的选择。我们还基于模型性能、文章主题、文章长度进行了若干分析,并讨论了从中得到的不同经验教训。我们相信该基准研究将有助于研究界进一步探索,并帮助新闻网站/博客选择最合适的假新闻检测方法。
引用
@article{arxiv.1905.04749,
title = {A Benchmark Study of Machine Learning Models for Online Fake News Detection},
author = {Junaed Younus Khan and Md. Tawkat Islam Khondaker and Sadia Afroz and Gias Uddin and Anindya Iqbal},
journal= {arXiv preprint arXiv:1905.04749},
year = {2021}
}
备注
22 pages, 5 figures, to be published in Machine Learning with Applications journal