中文

面向GRPO代码生成的执行导向信用分配

机器学习 2026-03-18 v1

摘要

无批评家的强化学习与可验证奖励(RLVR)通过优化单元测试通过率来提高代码生成质量, 但GRPO式更新 suffers from粗糙信用分配: 单一结果信号在长时间程序上均匀扩散, 即使失败源于局部语义错误亦是如此。我们提出执行导向信用分配(EGCA), 通过执行轨迹来局部化GRPO更新。对于满足算法约束但失败测试的程序, EGCA在相同的仪表下执行候选程序和一个经离线精选的规范参考解决方案(用于分析, 不用于监督), 识别最早的语义偏离, 并仅为相应标记范围分配优势 同时屏蔽下游标记。EGCA是一种即插即用的修改, 无需批评家、 辅助损失或学习验证器, 在HumanEval上实现82.1%的pass@1(比GRPO高出3.1), 在MBPP上实现68.9%(高出1.5), 仅增加18%的 wall-clock开销。

关键词

引用

@article{arxiv.2603.16158,
  title  = {Execution-Grounded Credit Assignment for GRPO in Code Generation},
  author = {Abhijit Kumar and Natalya Kumar and Shikhar Gupta},
  journal= {arXiv preprint arXiv:2603.16158},
  year   = {2026}
}

备注

Accepted at SPOT ICLR 2026 (https://openreview.net/forum?id=nqkVB5EVXJ)