为何微调会诱发幻觉及如何修复
计算与语言
2026-04-20 v1 人工智能
机器学习
神经与进化计算
摘要
大型语言模型容易产生事实上不正确的幻觉陈述。这些错误的一个关键来源是在监督微调(SFT)过程中接触到新的事实信息,这可能会增加相对于预训练期间所获知识的幻觉。在本工作中,我们探讨是否可以利用持续学习文献中的成熟工具来缓解 SFT 诱发的幻觉,因为它们是训练过程中知识退化的副产品。我们提出了一种基于自蒸馏的 SFT 方法,通过对输出分布漂移进行正则化,在促进有效事实学习的同时,最小化相对于已有知识的幻觉。我们还表明,在无需获取新知识的场景下,通过冻结参数组来抑制事实可塑性,可以在保持任务性能的同时减少幻觉。最后,我们通过三个假设——容量限制、行为克隆和局部干扰——研究了 SFT 诱发幻觉背后的机制。我们的实验表明,主要驱动因素是重叠语义表征之间的干扰,而自蒸馏通过缓解这种干扰取得了成功。
引用
@article{arxiv.2604.15574,
title = {Why Fine-Tuning Encourages Hallucinations and How to Fix It},
author = {Guy Kaplan and Zorik Gekhman and Zhen Zhu and Lotem Rozner and Yuval Reif and Swabha Swayamdipta and Derek Hoiem and Roy Schwartz},
journal= {arXiv preprint arXiv:2604.15574},
year = {2026}
}