HACK:沿确定性与知识轴的幻觉
计算与语言
2025-10-29 v1
摘要
大语言模型(LLM)中的幻觉是其可靠使用的关键障碍。现有研究通常根据外部属性而非 LLM 内部属性对幻觉进行分类。这种外部视角忽略了幻觉可能需要根据其底层机制采取有针对性的缓解策略。我们提出了一种沿两个轴——知识轴和确定性轴——对幻觉进行分类的框架。由于参数化知识和确定性可能在不同模型间存在差异,我们的分类方法涉及模型特定的数据集构建过程,以区分这些类型的幻觉。沿知识轴,我们区分由知识缺乏引起的幻觉与尽管模型拥有正确响应知识但仍发生的幻觉。为验证我们框架在知识轴上的有效性,我们应用 steering 缓解方法,该方法依赖于参数化知识的存在来操纵模型激活。这通过展示两种幻觉类型之间存在显著差异来弥补现有方法在验证知识分类方面的不足。我们进一步分析了不同模型之间不同的知识和幻觉模式,表明即使共享参数化知识,不同类型的幻觉仍会发生。转向确定性轴,我们识别出一类特别令人担忧的幻觉子集,即模型在内部拥有正确知识的情况下仍然确信地产生幻觉。我们引入了一种新的评估指标来衡量缓解方法在该子集上的有效性,揭示了一些方法虽然在平均性能上表现良好,但在这些关键案例上却表现不佳。我们的发现强调了在幻觉分析中同时考虑知识和确定性的重要性,并呼吁针对幻觉底层因素采取有针对性的缓解方法。
引用
@article{arxiv.2510.24222,
title = {HACK: Hallucinations Along Certainty and Knowledge Axes},
author = {Adi Simhi and Jonathan Herzig and Itay Itzhak and Dana Arad and Zorik Gekhman and Roi Reichart and Fazl Barez and Gabriel Stanovsky and Idan Szpektor and Yonatan Belinkov},
journal= {arXiv preprint arXiv:2510.24222},
year = {2025}
}
备注
The code is available at https://github.com/technion-cs-nlp/HACK_Hallucinations_Along_Certainty_and_Knowledge_axes