大语言模型生成假新闻检测中的挑战:测量与解释
计算与语言
2026-02-05 v1 人工智能
信息检索
机器学习
摘要
凭借其先进能力,大型语言模型(LLM)能够生成高度令人信服且语境相关的假新闻,这可能导致虚假信息的传播。尽管关于人类撰写文本的假新闻检测已有大量研究,但针对检测大语言模型生成的假新闻的研究仍相对不足。本研究衡量检测器识别大语言模型改写后的假新闻效果,特别是确定在检测流程中加入改写步骤是有助于还是妨碍检测。本研究的贡献包括:(1)检测器在识别大语言模型改写后的假新闻的能力比识别人类撰写的文本更为吃力;(2)我们发现哪些模型在哪些任务中表现更好(规避检测、改写以规避检测、以及为语义相似性进行改写);(3)通过LIME解释,我们发现检测失败的可能原因:情感倾向的变化。(4)我们发现改写质量测量中的一个令人关切的趋势:尽管BERTSCORE较高,但仍出现情感倾向变化的样本。(5)我们提供了一对数据集,增强了现有数据集,包含改写输出和分数。该数据集可在GitHub上获取。
引用
@article{arxiv.2501.18649,
title = {Fake News Detection After LLM Laundering: Measurement and Explanation},
author = {Rupak Kumar Das and Jonathan Dodge},
journal= {arXiv preprint arXiv:2501.18649},
year = {2026}
}