Critique-RL:通过两阶段强化学习训练语言模型进行批评
计算与语言
2025-10-29 v1 人工智能
摘要
训练能评估和提供反馈的批评型语言模型是提升大语言模型处理复杂推理任务的有前景之路。然而,现有方法通常依赖更强的监督者为批评数据标注。为此,我们提出Critique-RL,一种无需更强监督的在线强化学习方法,用于发展批评型语言模型。我们的方法基于两玩家范式:actor 生成响应,critic 提供反馈,actor 根据反馈不断精炼响应。我们首次指出,仅依赖 actor 输出的间接奖励信号进行 RL 优化往往导致批评模型表现不佳:虽然其帮助性(即提供建设性反馈)有所提升,但判别性(即判断响应质量高低)仍不足,导致性能提升有限。为此,Critique-RL 采用两阶段优化策略。阶段 I 中,通过直接基于规则的奖励信号强化批评者的判别性;阶段 II 中引入基于 actor 精炼的间接奖励,以提升批评者的帮助性,同时通过适当正则化维持其判别性。广泛实验表明,Critique-RL 能显著提升性能。例如,针对 Qwen2.5-7B,在领域内任务中实现 9.02% 的提升,在领域外任务中实现 5.70% 的提升,凸显了其潜力。
引用
@article{arxiv.2510.24320,
title = {Critique-RL: Training Language Models for Critiquing through Two-Stage Reinforcement Learning},
author = {Zhiheng Xi and Jixuan Huang and Xin Guo and Boyang Hong and Dingwen Yang and Xiaoran Fan and Shuo Li and Zehui Chen and Junjie Ye and Siyu Yuan and Zhengyin Du and Xuesong Yao and Yufei Xu and Jiecao Chen and Rui Zheng and Tao Gui and Qi Zhang and Xuanjing Huang},
journal= {arXiv preprint arXiv:2510.24320},
year = {2025}
}
备注
Preprint, 25 pages, 9 figures. Code: https://github.com/WooooDyy/Critique-RL