中文

基于内部注意力发散信号检测大语言模型中的幻觉

计算与语言 2026-05-07 v1

摘要

我们提出一种轻量级且单次 pass 的不确定性量化方法,用于检测大语言模型中的幻觉。该方法利用注意力矩阵来估计不确定性,无需重复抽样或外部模型。具体而言,我们测量每个注意力头分布与均匀参考分布之间的 Kullback-Leibler 发散,并将这些特征用于逻辑回归探针。在多个数据集、任务类型和模型家族中,注意力发散高度预测答案的正确性,并在与现有不确定性估计方法中表现出竞争力。我们发现,这一信号集中在中间层和事实性标记(如专有名词和数字)上,表明注意力动力学提供了一种高效且可解释的模型不确定性白盒信号。

关键词

引用

@article{arxiv.2605.05025,
  title  = {Detecting Hallucinations in Large Language Models via Internal Attention Divergence Signals},
  author = {Gijs van Dijk},
  journal= {arXiv preprint arXiv:2605.05025},
  year   = {2026}
}

备注

ACL SRW 2026