中文

CRITIC-R1:用于检索增强生成的结构化批评学习

计算与语言 2026-05-29 v1 人工智能

摘要

检索增强生成(RAG)通过融合外部证据来改进知识密集型问答,但现有 RAG 方法仍受幻觉和细微推理错误的困扰。最近的研究引入外部批评者以细化 RAG 输出,但这些批评者往往提供粗糙且缺乏结构化的反馈,干预过于激进,导致噪声且不可靠的细化,从而限制了其纠错效果。为此,我们提出 CRITIC-R1,一种结构化批评框架,将 RAG 批评形式化为显式错误诊断问题,并利用强化学习(RL)进行学习。我们的框架将常见的 RAG 错误划分为多个诊断维度,包括裁决、错误位置、推理分析和修复生成。为学习这些能力,我们设计两种奖励函数:保守裁决对齐(CJA)首先鼓励校准的高层裁决,同时缓解过度干预现象;而诊断质量对齐(DQA)则通过门控奖励进一步改善细粒度诊断反馈。我们采用基于 GRPO 的 RL 训练批评模型,利用来自外部大语言模型教师模型收集的过程级监督信号。跨越五个问答基准的实验表明,CRITIC-R1 在强 RAG 基线上 consistently 提升了答案质量。我们的源码可在 https://anonymous.4open.science/r/critic-r1-FCB0 查阅。

关键词

引用

@article{arxiv.2605.29886,
  title  = {CRITIC-R1: Learning Structured Critics for Retrieval-Augmented Generation},
  author = {Wenhan Xiao and Ziwei Zhang and Chuanyue Yu and Xingcheng Fu and Qingyun Sun and Runhua Xu and Jianxin Li},
  journal= {arXiv preprint arXiv:2605.29886},
  year   = {2026}
}

备注

17 pages,13 figures