面向透明 RAG:通过强化学习在 LLM 生成中促进证据可追溯性
计算与语言
2026-01-30 v3
摘要
检索增强生成 (RAG) 在知识密集型应用中提供了巨大价值。然而,其生成的响应往往缺乏透明的推理路径,无法追溯到检索文档中的来源证据。这种不透明性不仅削弱了输出的可解释性,也限制了模型充分利用提供上下文的能力。为此,我们提出了 TRACE (evidenCE tracing with Transparent RAG),一个通过强化学习 (RL) 提升大语言模型 (LLM) 中证据可追溯性的框架。TRACE 通过引导 LLM 生成带有明确证据引用的结构化输出,奖励证据相关性和正确格式化,同时考虑准确性,以优化结构化可追溯性。为确保多奖励信号训练的稳定性,我们进一步引入了奖励合并的自适应策略,并采用稳定的 KL 散度估计器。在使用 Qwen2.5-7B-Instruct 和 Llama-3.1-8B-Instruct 在三个多跳问答数据集上的实验表明,TRACE 实现了透明且可追溯证据的输出,同时实现了 10-30% 的准确率提升。 resulting performance 与先进的商业 LLM(如 OpenAI o1、DeepSeek-R1)相当。进一步分析表明,其泛化能力强于未见任务。我们的代码已公开。
引用
@article{arxiv.2505.13258,
title = {Towards Transparent RAG: Fostering Evidence Traceability in LLM Generation via Reinforcement Learning},
author = {Jingyi Ren and Yekun Xu and Xiaolong Wang and Weitao Li and Ante Wang and Weizhi Ma and Yang Liu},
journal= {arXiv preprint arXiv:2505.13258},
year = {2026}
}