中文

ICRL:通过强化学习学习内部化自我批判

人工智能 2026-05-18 v1 多智能体系统

摘要

大语言模型代理会出错,但批判常能引导同一模型通向正确行为。然而,若批判被移除,模型可能在同一查询上再次失败,表明其未将批判的指导内化为底层能力。同时,冻结批判无法随时间提升反馈质量,限制了迭代自我改进的潜力。为此,我们提出通过强化学习学习内部化自我批判(ICRL),一种新框架,联合训练 solver 与 critic 从共享 backbone 将批判引导的成功转化为无代理 solver 能力。批判基于 solver 随后性能提升获得奖励,以激励可操作反馈。为解决批判条件化与无批判行为之间的分布迁移,ICRL 引入分布校准再加权比率选择性地将批判引导的改进转移至与 solver 自身提示分布兼容的情形。此外,角色相关的群体优势估计稳定了双角色的联合优化。这些机制确保 solver 学习在无外部批判下提升自身能力,而非依赖批判条件化行为。我们在涵盖 agentic 与数学推理任务的 diverse benchmarks 上评估 ICRL,采用 Qwen3-4B 与 Qwen3-8B 作为 backbone。结果显示性能持续提升,agentic 任务平均提升 6.4 分,数学推理提升 7.0 分。值得注意的是,所学 8B 批判的表现可与 32B 批判相当,却使用了大幅更少的 token。代码已公开于 https://github.com/brick-pid/ICRL。

关键词

引用

@article{arxiv.2605.15224,
  title  = {ICRL: Learning to Internalize Self-Critique with Reinforcement Learning},
  author = {Jianbo Lin and Xiaomin Yu and Yi Xin and Yifu Guo and Zhuosong Jiang and Zhongqi Yue and Weishi Wang and Heqing Zou and Chengwei Qin and Hui Xiong},
  journal= {arXiv preprint arXiv:2605.15224},
  year   = {2026}
}