基于多模态弱信号的无监督领域无关假新闻检测
机器学习
2023-05-22 v1 计算与语言
摘要
社交媒体作为人们获取新闻的主要平台之一,其出现使得假新闻得以广泛传播。这促使了大量关于自动化假新闻检测的研究。尽管已有少量无监督假新闻检测的尝试,但由于未利用新闻记录中各种模态的知识,且现有新闻数据集中存在各种潜在偏差,其性能受到影响。为应对这些局限,本工作提出了一种有效的无监督假新闻检测框架,该框架首先嵌入新闻记录中四种模态的可用知识,随后提出一种新颖的噪声鲁棒自监督学习技术,以从多模态嵌入中识别新闻记录的真实性。此外,我们提出了一种新技术来构建新闻数据集,以最小化现有新闻数据集中的潜在偏差。遵循所提出的数据集构建方法,我们生成了一个包含419,351篇与COVID-19相关新闻文章的大规模无标签新闻数据集,缩写为LUND-COVID。我们使用LUND-COVID训练所提出的无监督框架以利用大型数据集的潜力,并使用一组现有标签数据集对其进行评估。我们的结果表明,所提出的无监督框架在多模态假新闻检测、假新闻早期检测和少样本假新闻检测等不同任务上大幅优于现有的无监督基线,同时在训练期间对未见领域也取得了显著改进。
引用
@article{arxiv.2305.11349,
title = {Unsupervised Domain-agnostic Fake News Detection using Multi-modal Weak Signals},
author = {Amila Silva and Ling Luo and Shanika Karunasekera and Christopher Leckie},
journal= {arXiv preprint arXiv:2305.11349},
year = {2023}
}
备注
15 pages