中文

TPA:用于检测RAG中幻觉的下一标记概率归因

计算与语言 2026-04-20 v4 人工智能

摘要

检索增强生成(RAG)中的幻觉检测仍是一项挑战。先前的方法将幻觉归因于存储在FFN中的内部知识与检索上下文之间的二元冲突。然而,这一视角是不完整的,未能考虑LLM其他组件的影响,例如用户查询、先前生成的标记、自标记和最终的LayerNorm调整。为全面捕捉这些组件对幻觉检测的影响,我们提出了TPA,它将每个标记的概率数学地归因于七个不同来源:Query、RAG Context、Past Token、Self Token、FFN、Final LayerNorm和Initial Embedding。这种归因量化了每个来源对下一个标记生成的贡献。具体而言,我们按词性(POS)标签汇总这些归因分数,以量化每个模型组件对响应中特定语言类别生成的贡献。通过利用这些模式,例如检测名词严重依赖LayerNorm的异常情况,TPA能够有效识别幻觉响应。大量实验表明TPA达到了最先进的性能。

关键词

引用

@article{arxiv.2512.07515,
  title  = {TPA: Next Token Probability Attribution for Detecting Hallucinations in RAG},
  author = {Pengqian Lu and Jie Lu and Anjin Liu and Guangquan Zhang},
  journal= {arXiv preprint arXiv:2512.07515},
  year   = {2026}
}

备注

Accepted by ACL 2026