在对抗情感攻击下使用大语言模型进行鲁棒虚假新闻检测
计算与语言
2026-01-22 v1
摘要
错误信息和虚假新闻已成为紧迫的社会挑战,推动了对可靠自动化检测方法的需求。先前的研究强调了情感是虚假新闻检测中的重要信号,其方式要么是分析与虚假新闻相关的情感,要么是使用情感和情绪特征进行分类。然而,这带来了一个漏洞,因为攻击者可以操纵情感以规避检测器,尤其是在大语言模型(LLM)出现的情况下。少数研究探讨了由 LLM 生成的对抗样本,但它们主要侧重于新闻发布者写作风格等文体特征。因此,情感操纵这一关键漏洞在很大程度上仍未被探索。在本文中,我们研究了最先进的虚假新闻检测器在情感操纵下的鲁棒性。我们引入了 AdSent,这是一个对情感鲁棒的检测框架,旨在确保对原始新闻文章和情感被篡改的新闻文章都能做出一致的真相预测。具体而言,我们 (1) 提出使用 LLM 进行受控的基于情感的对抗攻击,(2) 分析情感转变对检测性能的影响。我们发现,改变情感会严重影响虚假新闻检测模型的性能,表明模型存在将中立文章视为真实的偏见,而非中立文章通常被分类为虚假内容。(3) 我们引入了一种新颖的与情感无关的训练策略,以增强对此类扰动的鲁棒性。在三个基准数据集上的大量实验表明,AdSent 在准确性和鲁棒性上均显著优于有竞争力的基线,同时也能有效地泛化到未见过的数据集和对抗场景。
引用
@article{arxiv.2601.15277,
title = {Robust Fake News Detection using Large Language Models under Adversarial Sentiment Attacks},
author = {Sahar Tahmasebi and Eric Müller-Budack and Ralph Ewerth},
journal= {arXiv preprint arXiv:2601.15277},
year = {2026}
}