弱反馈下智能体代码修复的GRPO信号重塑
人工智能
2026-05-11 v1
摘要
代码智能体RL往往接收到的反馈较为薄弱:滚动时间信号可靠且可执行,但仅捕获任务成功所必需的或表面条件,而非目标语义谓词。以agentic compile-fix为设定,本文研究标准GRPO下的信号重塑。我们的核心论点是,只有在三类信号被重塑后,GRPO的组内比较才有意义:结果奖励恢复语义排序,过程信号局部轨迹信用,以及来自相同提示的滚动保持可执行性。我们通过一种最小化的信号重塑构造实现这些条件,使GRPO的组归一化优势构建保持不变:编译与语义分层奖励重塑轨迹排序,步骤级过程得分在组奖励归一化之外重塑轨迹内更新强度,失败原因感知的滚动治理重塑组内可比性。实验显示,明显的端到端收益:完全信号重塑的GRPO将基线模型的零样本编译与语义准确率从0.385提升至0.535。受控比较进一步解释了此收益的来源:二元奖励去除仅编译的中间层并损害轨迹控制;在分层奖励之上,过程得分加权进一步将准确率提升至0.53并将平均评估步骤从23.50降至17.02。作为边界比较,特权提示标记级蒸馏主要优化局部分布对齐;在长工具使用轨迹中,这种信号被非关键标记稀释,无法取代结果语义、过程信用或组内可比性。
引用
@article{arxiv.2605.07276,
title = {Signal Reshaping for GRPO in Weak-Feedback Agentic Code Repair},
author = {Jia Li and Yuxin Su and Ting Peng and Hailiang Huang and Yuetang Deng and Michael R. Lyu},
journal= {arXiv preprint arXiv:2605.07276},
year = {2026}
}