中文

理解LLM中新知识引发的事实性幻觉:分析与解释

计算与语言 2026-04-20 v3

摘要

先前的工作表明,对新知识进行微调会诱发大语言模型(LLM)产生事实性幻觉,导致在评估先前已知信息时输出错误结果。然而,这种幻觉的具体表现形式及其潜在机制仍未被充分理解。我们的工作通过设计一个受控数据集Biography-Reasoning,并在多种知识类型和两种任务类型(包括知识问答(QA)和知识推理任务)上进行细粒度分析,填补了这一空白。我们发现,幻觉不仅严重影响涉及新引入知识的任务,还会传播到其他评估任务。此外,当在特定知识类型完全由新知识组成的数据集上进行微调时,LLM表现出更高的幻觉倾向。这表明,特定知识类型内的不熟悉程度,而非新知识的总体比例,是幻觉更强的驱动因素。通过可解释性分析,我们表明学习新知识会削弱模型对输入问题中关键实体的注意力,导致过度依赖周围上下文,从而增加幻觉风险。相反,在训练后期重新引入少量已知知识,可以恢复对关键实体的注意力,并显著减轻幻觉行为。最后,我们证明了被破坏的注意力模式可以在词汇相似的上下文中传播,从而促进幻觉超越原始任务进行扩散。

关键词

引用

@article{arxiv.2511.02626,
  title  = {Understanding New-Knowledge-Induced Factual Hallucinations in LLMs: Analysis and Interpretation},
  author = {Renfei Dang and Peng Hu and Zhejian Lai and Changjiang Gao and Min Zhang and Shujian Huang},
  journal= {arXiv preprint arXiv:2511.02626},
  year   = {2026}
}

备注

ACL 2026 Findings