DHI:利用多样化幻觉诱导增强大型语言模型对抗幻觉控制
计算与语言
2026-01-06 v1
摘要
大型语言模型(LLMs)经常会产生不准确或虚构信息,称为"幻觉",这损害了其可靠性。现有方法通常训练一个"邪恶LLM"在精选数据集上有意生成幻觉信息,以此引导对抗解码,从而约束一个可靠的"正面模型"。然而,这一策略受限于幻觉诱导的单一多样性,因为在特定错误类型上训练的邪恶LLM仅会复现这些特定模式,从而限制了其整体效果。为此,我们提出DHI(多样化幻觉诱导),一种新型训练框架,使邪恶LLM能够在不依赖预标注幻觉数据的情况下生成更广泛的幻觉类型。DHI采用修改后的损失函数,对特定事实正确token的生成进行降权,鼓励邪恶LLM在目标位置生成多样化幻觉,同时保持整体事实内容。此外,我们引入因果注意力掩码适配,以减少这种惩罚对后续token生成的影响。在推理阶段,我们应用自适应理性约束,将对抗解码限制在正面模型表现出高置信度的token上,从而避免对事实正确token的不必要惩罚。广泛的实证结果表明,DHI在多个幻觉基准测试上相较于其他基于对抗解码的方法实现了显著的性能提升。
引用
@article{arxiv.2601.01156,
title = {DHI: Leveraging Diverse Hallucination Induction for Enhanced Contrastive Factuality Control in Large Language Models},
author = {Jiani Guo and Xiangke Zeng and Jie Wu and Zuchao Li},
journal= {arXiv preprint arXiv:2601.01156},
year = {2026}
}
备注
ICONIP 2025