假新闻检测器对大语言模型生成的文本存在偏见
计算与语言
2023-09-19 v1 人工智能
摘要
假新闻的传播已成为一项关键挑战,破坏信任并对社会构成威胁。在大型语言模型(LLMs)时代,生成可信假内容的能力加剧了这些担忧。在本研究中,我们提出了一种新颖的范式,用于在涉及人类撰写和 LLM 生成的错误信息的场景中评估假新闻检测器。有趣的是,我们的发现揭示了许多现有检测器中的显著偏见:它们更倾向于将 LLM 生成的内容标记为假新闻,同时常将人类撰写的假新闻误分类为真实。这种意外的偏见似乎源于 LLM 输出所固有的独特语言模式。为此,我们引入了一种缓解策略,利用经 LLM 改写真实新闻的对抗训练。所得模型在人类和 LLM 生成新闻的检测准确性上均取得显著改进。为了进一步促进该领域的研究,我们发布了两个综合数据集,\texttt{GossipCop++} 和 \texttt{PolitiFact++},从而将人工验证的文章与 LLM 生成的假新闻和真实新闻合并在一起。
引用
@article{arxiv.2309.08674,
title = {Fake News Detectors are Biased against Texts Generated by Large Language Models},
author = {Jinyan Su and Terry Yue Zhuo and Jonibek Mansurov and Di Wang and Preslav Nakov},
journal= {arXiv preprint arXiv:2309.08674},
year = {2023}
}
备注
The first two authors contributed equally