通过组相似奖励提高检索增强系统一致性
计算与语言
2025-10-07 v1 人工智能
计算机与社会
机器学习
摘要
检索增强生成(RAG)系统在高风险领域日益部署,用户期望其在语义等价查询下输出一致。然而,现有系统因检索器和生成器(大语言模型)的变异性,常表现出显著不一致性,削弱信任与可靠性。本文聚焦信息一致性,即要求在语义等价输入下输出传递相同核心内容。我们提出了一种原则化评估框架,将RAG一致性分解为检索器级、生成器级和端到端组件,有助于识别不一致来源。为提升一致性,我们提出Paraphrased Set Group Relative Policy Optimization (PS-GRPO),这是一种利用语义等价查询集合进行多次抽样以分配组相似奖励的强化学习方法。我们利用PS-GRPO实现信息一致RAG(Con-RAG),训练生成器在语义等价查询下生成一致输出,并对检索引起的变异性保持鲁棒性。由于对语义等价查询集合进行精确奖励计算计算成本高昂,我们还引入一种可扩展近似方法,既保持有效性又可实现高效大规模训练。跨短文本、多跳和长文本问答基准的实证评估表明,Con-RAG在强基线上显著提升了一致性和准确性,即使无需明确的ground-truth监督亦然。我们的工作为在安全关键部署中评估和构建可靠RAG系统提供了实用解决方案。
引用
@article{arxiv.2510.04392,
title = {Improving Consistency in Retrieval-Augmented Systems with Group Similarity Rewards},
author = {Faisal Hamman and Chenyang Zhu and Anoop Kumar and Xujun Peng and Sanghamitra Dutta and Daben Liu and Alfy Samuel},
journal= {arXiv preprint arXiv:2510.04392},
year = {2025}
}
备注
Accepted at NeurIPS 2025 Workshop on Reliable ML from Unreliable Data