ICR探针:用于可靠检测LLM幻觉的隐藏状态动态跟踪
计算与语言
2025-07-23 v1 人工智能
摘要
大型语言模型 (LLM) 在various natural language processing tasks中表现出色,但其倾向于生成幻觉导致可靠性受到挑战。现有的幻觉检测方法利用隐藏状态主要关注静态和孤立的表示,忽略其在各层之间的动态演化,限制了效果。为此,我们转向关注隐藏状态更新过程,引入一种新指标——ICR得分 (Information Contribution to Residual Stream),以量化模块对隐藏状态更新的贡献。我们实证验证了ICR得分在区分幻觉方面有效可靠。基于这些洞见,我们提出了一种幻觉检测方法——ICR探针,该方法捕获隐藏状态的跨层演化。实验结果表明,ICR探针在显著减少参数数量的同时实现了卓越的性能。此外,消融研究和案例分析提供了对该方法背后机制更深入的见解,提高了其可解释性。
引用
@article{arxiv.2507.16488,
title = {ICR Probe: Tracking Hidden State Dynamics for Reliable Hallucination Detection in LLMs},
author = {Zhenliang Zhang and Xinyu Hu and Huixuan Zhang and Junzhe Zhang and Xiaojun Wan},
journal= {arXiv preprint arXiv:2507.16488},
year = {2025}
}
备注
Accepted to ACL 2025 (Main Conference)