中文

面向细粒度幻觉检测的跨层注意力探测

计算与语言 2025-09-15 v1 人工智能

摘要

随着大型语言模型(LLM)在 various applications 中的广泛采用,由于其倾向于生成不准确文本(即幻觉),存在日益增长的可靠性担忧。本文提出了跨层注意力探测(CLAP),一种 novel activation probing 技术,用于幻觉检测,该技术将整个残差流中的 LLM 激活作为一个联合序列进行处理。我们使用五种 LLM 和三个任务进行的经验评估表明,CLAP 在 greedy 解码响应以及来自更高温度采样的响应上,都比基线方法在幻觉检测方面表现更好,从而实现细粒度检测,即能够在给定提示的不同采样响应中消除幻觉和非幻觉响应。这使我们能够提出一种基于 CLAP 的检测-缓解策略,以减少幻觉并提高 LLM 的可靠性,而与直接的缓解方法相比后者效果更差。最后,我们展示了 CLAP 即使在 out-of-distribution 情况下也保持高可靠性。

关键词

引用

@article{arxiv.2509.09700,
  title  = {Cross-Layer Attention Probing for Fine-Grained Hallucination Detection},
  author = {Malavika Suresh and Rahaf Aljundi and Ikechukwu Nkisi-Orji and Nirmalie Wiratunga},
  journal= {arXiv preprint arXiv:2509.09700},
  year   = {2025}
}

备注

To be published at the TRUST-AI workshop, ECAI 2025