基于稀疏自编码器的忠实检索增强生成
计算与语言
2026-02-12 v2 人工智能
摘要
检索增强生成(RAG)通过将输出锚定在检索到的证据上,提升了大语言模型(LLM)的事实性,但忠实性失败——即生成内容与提供的来源相矛盾或超出来源范围——仍然是一个关键挑战。现有的RAG幻觉检测方法要么依赖大规模检测器训练,需要大量标注数据,要么依赖查询外部LLM评判器,导致高推理成本。虽然一些方法尝试利用LLM的内部表示进行幻觉检测,但其准确度仍然有限。受机械可解释性最新进展的启发,我们利用稀疏自编码器(SAE)来解耦内部激活,成功识别出在RAG幻觉期间被特异性触发的特征。基于基于信息论的特征选择和加性特征建模的系统流程,我们引入了RAGLens,一个轻量级幻觉检测器,利用LLM内部表示准确标记不忠实的RAG输出。RAGLens不仅相比现有方法取得了优越的检测性能,还提供了其决策的可解释理由,从而实现了对不忠实RAG的有效事后缓解。最后,我们验证了设计选择的合理性,并揭示了LLM内部与幻觉相关信号的分布新见解。代码可在https://github.com/Teddy-XiongGZ/RAGLens获取。
引用
@article{arxiv.2512.08892,
title = {Toward Faithful Retrieval-Augmented Generation with Sparse Autoencoders},
author = {Guangzhi Xiong and Zhenghao He and Bohan Liu and Sanchit Sinha and Aidong Zhang},
journal= {arXiv preprint arXiv:2512.08892},
year = {2026}
}
备注
ICLR 2026