注意力汇聚点作为大语言模型中幻觉检测的内部信号
计算与语言
2026-04-14 v1 机器学习
摘要
大语言模型经常表现出幻觉:流畅且自信的输出,但事实不正确或不受输入上下文支持。虽然最近的幻觉检测方法探索了从注意力图中导出的各种特征,但它们所利用的底层机制仍然知之甚少。在这项工作中,我们提出了SinkProbe,一种基于以下观察的幻觉检测方法:幻觉与注意力汇聚点(在生成过程中累积不成比例注意力权重的标记)深度纠缠,表明从分布式的、基于输入的注意力向压缩的、先验主导的计算的转变。重要的是,尽管汇聚点分数仅从注意力图计算得出,但我们发现分类器优先依赖于其关联值向量具有大范数的汇聚点。此外,我们通过建立先前方法与汇聚点分数的数学关系,表明它们隐含地依赖于注意力汇聚点。我们的发现产生了一种新颖的、基于理论的幻觉检测方法,在流行的数据集和大语言模型上取得了最先进的结果。
引用
@article{arxiv.2604.10697,
title = {Attention Sinks as Internal Signals for Hallucination Detection in Large Language Models},
author = {Jakub Binkowski and Kamil Adamczewski and Tomasz Kajdanowicz},
journal= {arXiv preprint arXiv:2604.10697},
year = {2026}
}