知识被掩盖定律:理解、预测与预防LLM幻觉
计算与语言
2025-02-25 v1
摘要
幻觉是大型语言模型(LLM)中的持久挑战,即使经过严格的质量控制,模型仍常生成扭曲的事实。这一悖论——尽管拥有高质量训练数据,错误生成仍然持续,呼吁我们深入理解其底层LLM机制。为此,我们提出了一种新概念:知识被掩盖,模型的主导知识在文本生成过程中会掩盖较不突出的知识,导致模型生成不准确的细节。基于此想法,我们引入了一种新框架来量化事实性幻觉,通过建模知识被掩盖来实现。我们方法的核心是对数线性定律,预测事实性幻觉率随(1)知识流行度、(2)知识长度、(3)模型规模的对数尺度线性增长。该定律提供了一种预先量化幻觉的手段,甚至在模型训练或推理之前即可洞察其发生。基于掩盖效应,我们提出了一种新的解码策略CoDa,以缓解幻觉,显著提高模型在Overshadow(27.9%)、MemoTrap(13.1%)和NQ-Swap(18.3%)上的事实准确性。我们的发现不仅深化了对幻觉背后机制的理解,也为开发更可预测、可控的语言模型提供了可行的见解。
引用
@article{arxiv.2502.16143,
title = {The Law of Knowledge Overshadowing: Towards Understanding, Predicting, and Preventing LLM Hallucination},
author = {Yuji Zhang and Sha Li and Cheng Qian and Jiateng Liu and Pengfei Yu and Chi Han and Yi R. Fung and Kathleen McKeown and Chengxiang Zhai and Manling Li and Heng Ji},
journal= {arXiv preprint arXiv:2502.16143},
year = {2025}
}
备注
19 pages, 5 figures