中文

超越黑盒干预:面向可靠检索增强生成的潜在探针

计算与语言 2026-04-16 v3

摘要

检索增强生成 (RAG) 系统常常无法维持上下文的忠实性,生成的响应可能与提供的上下文相冲突,或未能充分利用提供的证据。现有方法通过外部干预(如 specialized prompting、decoding-based calibration 或 preference optimization)来提高忠实性。然而,由于这些方法将 LLM 视为黑盒,缺乏可靠的机制来评估何时以及为何会发生知识冲突。因此,这些方法往往脆弱、数据密集,且对模型的内部推理过程漠不关心。本文我们超越黑盒干预,分析模型的内部推理过程。我们发现,冲突和一致的知识状态在模型潜在空间中是线性可分的,上下文噪声会系统性地增加这些表示的熵值。基于这些发现,我们提出 ProbeRAG,一个用于可靠 RAG 的新框架,其在三个阶段运行:(i) 细粒度知识修剪以过滤无关上下文,(ii) 潜在冲突探针以识别模型潜在空间中的硬冲突,以及 (iii) 冲突感知注意力以调制注意力头以实现对忠实上下文的集成。广泛的实验表明,ProbeRAG 在 accuracy 和上下文忠实性方面显著提升。相关资源已公开于 https://github.com/LinfengGao/ProbeRAG。

关键词

引用

@article{arxiv.2510.12460,
  title  = {Beyond Black-Box Interventions: Latent Probing for Faithful Retrieval-Augmented Generation},
  author = {Linfeng Gao and Qinggang Zhang and Baolong Bi and Bo Zeng and Zheng Yuan and Zerui Chen and Zhimin Wei and Shenghua Liu and Linlong Xu and Longyue Wang and Weihua Luo and Jinsong Su},
  journal= {arXiv preprint arXiv:2510.12460},
  year   = {2026}
}

备注

ACL 2026 Findings; Code is available at https://github.com/LinfengGao/ProbeRAG