面向大语言模型错误信息的主动防御策略综述
信息检索
2025-07-09 v1 人工智能
计算与语言
摘要
大语言模型(LLMs)在关键领域中的广泛部署,放大了算法生成错误信息所带来的社会风险。与传统虚假内容不同,LLM 生成的错误信息具有自我强化、高度可信且能跨多种语言快速传播的特点,传统的检测方法难以有效应对。本文提出一种主动防御范式,将研究重心从被动的事后检测转向前瞻性的缓解策略。我们提出一个"三大支柱"框架:(1) 知识可信性——强化训练与部署数据的完整性;(2) 推理可靠性——在推理过程中嵌入自我纠错机制;(3) 输入鲁棒性——增强模型接口抵御对抗攻击的能力。通过对现有技术的全面综述与对比性元分析,我们证明主动防御策略在错误信息预防方面较传统方法可带来高达 63% 的提升,尽管其存在不可忽视的计算开销与泛化挑战。我们认为,未来研究应聚焦于鲁棒的知识基础、推理认证与抗攻击接口的协同设计,以确保 LLMs 能够在不同领域有效应对错误信息。
引用
@article{arxiv.2507.05288,
title = {A Survey on Proactive Defense Strategies Against Misinformation in Large Language Models},
author = {Shuliang Liu and Hongyi Liu and Aiwei Liu and Bingchen Duan and Qi Zheng and Yibo Yan and He Geng and Peijie Jiang and Jia Liu and Xuming Hu},
journal= {arXiv preprint arXiv:2507.05288},
year = {2025}
}
备注
Accepted by ACL 2025 Findings