中文

超越可验证奖励:基于 Rubric 的生成式奖励模型用于强化微调 SWE 代理

机器学习 2026-04-21 v1 人工智能 软件工程

摘要

尽管最近在大型语言模型(LLM)代理用于软件工程(SWE)任务方面取得了进展,但端到端微调通常依赖可验证的终端奖励,如所有单元测试是否通过。虽然这些二元信号反映最终解决方案是否正确,但它们为在多步骤交互期间塑造中间行为提供了有限的指导,从而限制了整体解决方案过程质量的提高。为此,我们引入了一个基于 Rubric 的生成式奖励模型(GRM),提供更丰富的学习信号。GRM 配备了人类设计的 Rubric,以指示鼓励或阻止特定行为模式的准则,我们利用此反馈为高质量训练数据收集通过轨迹过滤。当用于 SWE 任务的强化微调(RFT)时,我们的方法在终端得分仅用的拒绝抽样方面表现更佳:它更有效地抑制不 desirable 的模式,同时促进有益模式,正如案例分析所示,并且最终提高了最终测试准确率。

关键词

引用

@article{arxiv.2604.16335,
  title  = {Beyond Verifiable Rewards: Rubric-Based GRM for Reinforced Fine-Tuning SWE Agents},
  author = {Jiawei Huang and Qingping Yang and Renjie Zheng and Jiaze Chen},
  journal= {arXiv preprint arXiv:2604.16335},
  year   = {2026}
}