中文

ICR探针:用于可靠检测LLM幻觉的隐藏状态动态跟踪

计算与语言 2025-07-23 v1 人工智能

摘要

大型语言模型 (LLM) 在various natural language processing tasks中表现出色,但其倾向于生成幻觉导致可靠性受到挑战。现有的幻觉检测方法利用隐藏状态主要关注静态和孤立的表示,忽略其在各层之间的动态演化,限制了效果。为此,我们转向关注隐藏状态更新过程,引入一种新指标——ICR得分 (Information Contribution to Residual Stream),以量化模块对隐藏状态更新的贡献。我们实证验证了ICR得分在区分幻觉方面有效可靠。基于这些洞见,我们提出了一种幻觉检测方法——ICR探针,该方法捕获隐藏状态的跨层演化。实验结果表明,ICR探针在显著减少参数数量的同时实现了卓越的性能。此外,消融研究和案例分析提供了对该方法背后机制更深入的见解,提高了其可解释性。

关键词

引用

@article{arxiv.2507.16488,
  title  = {ICR Probe: Tracking Hidden State Dynamics for Reliable Hallucination Detection in LLMs},
  author = {Zhenliang Zhang and Xinyu Hu and Huixuan Zhang and Junzhe Zhang and Xiaojun Wan},
  journal= {arXiv preprint arXiv:2507.16488},
  year   = {2025}
}

备注

Accepted to ACL 2025 (Main Conference)