中文

基于 FEPOID 自动层选择的幻觉检测

人工智能 2026-05-29 v2 机器学习

摘要

近期研究表明,幻觉相关信号在大型语言模型(LLMs)的中间层比最终层中更强烈地编码。尽管已有越来越多的研究试图利用这一属性进行幻觉检测,但如何自动选择高性能层仍未得到充分探索,缺乏原则性的方法。为此,我们首先提出了若干假设解释为何这些信号在中间层中出现,并评估了相应的自动层选择标准,覆盖多种 LLM 架构、规模和任务,涵盖问答和摘要幻觉检测基准。然而,我们发现这些标准都无法持续提供满意的性能。因此,我们提出了一种新的选择标准,即 First Effective Peak of Intrinsic Dimension (FEPoID),该标准能够持续识别最优或接近最优的层,并超越前述标准和现有幻觉检测基线。FEPoID 无需训练,计算开销极小。此外,我们研究了 LLMs 的生成行为,引入一种简单而有效的截断策略,进一步放大幻觉相关信号,显著提升整体检测性能。代码已公开于 https://github.com/DesoloYw/Automatic-Layer-Selection-for-Hallucination-Detection.git。

关键词

引用

@article{arxiv.2605.26366,
  title  = {Automatic Layer Selection for Hallucination Detection},
  author = {Xinpeng Wang and William Cao and Andrew Gordon Wilson and Zhe Zeng},
  journal= {arXiv preprint arXiv:2605.26366},
  year   = {2026}
}

备注

Accepted at ICML 2026