信任我,我错了:尽管知道答案,LLM仍以确定性产生幻觉
计算与语言
2025-08-26 v2
摘要
先前关于大型语言模型(LLM)幻觉的研究将其与模型不确定性或不准确的知识关联起来。本文定义并研究了一种不同类型的幻觉,即模型能够持续正确回答问题,但看似微小的扰动(这种扰动在现实场景中可能发生)会导致其以高确定性产生幻觉响应。我们称这种现象为CHOKE(Certain Hallucinations Overriding Known Evidence),在医疗或法律等高风险领域尤其令人担忧,因为模型的确定性常被用作可靠性的代理指标。我们展示了CHOKE示例在不同提示下保持一致,在不同模型和数据集中出现,并且与其他幻觉本质上存在区别。这种差异导致现有缓解方法在CHOKE示例上比在一般幻觉上表现更差。最后,我们引入一种基于探测的缓解方法,在CHOKE幻觉方面超越了现有方法。这些发现揭示了幻觉的一个被忽视的方面,强调了需要理解其起源并改进缓解策略以增强LLM安全性的必要性。代码可在https://github.com/technion-cs-nlp/Trust_me_Im_wrong获取。
引用
@article{arxiv.2502.12964,
title = {Trust Me, I'm Wrong: LLMs Hallucinate with Certainty Despite Knowing the Answer},
author = {Adi Simhi and Itay Itzhak and Fazl Barez and Gabriel Stanovsky and Yonatan Belinkov},
journal= {arXiv preprint arXiv:2502.12964},
year = {2025}
}