中文

InterpDetect:用于检测检索增强生成(RAG)幻觉的可解释信号

计算与语言 2025-10-27 v1

摘要

检索增强生成(RAG)通过集成外部知识来缓解幻觉问题,但模型常生成与检索内容不一致的输出。准确的幻觉检测需要 disentangle 外部上下文与参数知识的贡献,而先前方法通常将二者混合。我们研究了 RAG 幻觉背后的机制,发现当后层前馈(FFN)模块在比例上过度将参数知识注入残差流时,便会引发幻觉。为此,我们探索一种基于外部上下文得分和参数知识得分的机制检测方法。使用 Qwen3-0.6b,我们计算各层和注意力头中的得分,并训练回归基的分类器来预测幻觉。我们的方法在 state-of-the-art 大语言模型(GPT-5、GPT-4.1)和检测基准(RAGAS、TruLens、RefChecker)之间进行评估。此外,我们展示基于 Qwen3-0.6b 信号训练的分类器能够泛化到 GPT-4.1-mini 回复,凸显了代理模型评估的潜在价值。我们的结果表明,机制信号作为 RAG 系统的幻觉检测器,具有效率高、可泛化的预测优势。

关键词

引用

@article{arxiv.2510.21538,
  title  = {InterpDetect: Interpretable Signals for Detecting Hallucinations in Retrieval-Augmented Generation},
  author = {Likun Tan and Kuan-Wei Huang and Joy Shi and Kevin Wu},
  journal= {arXiv preprint arXiv:2510.21538},
  year   = {2025}
}