合成轨迹是否反映真实的奖励钻取?对代码生成中野外钻取监控的系统性研究
机器学习
2026-04-28 v1
摘要
代码生成中的奖励钻取,即模型利用评估漏洞在正确解决任务前获取完整奖励,是强化学习 (RL) 和推理模型部署的关键挑战。现有研究主要基于合成钻取轨迹进行。然而,这些合成行为是否忠实地代表自然发生的野外钻取 remains unclear。在本工作中,我们对合成与野外奖励钻取之间的系统性差异进行分析。我们检验了通过提示诱导的钻取行为与 RL 训练期间出现的钻取行为到什么程度上存在相似性,以及基于合成轨迹训练的监控器是否能泛化到自然产生且之前未见过的钻取。为扩展野外奖励钻取轨迹的量身定制, 我们修改了 Group Relative Policy Optimization (GRPO),通过注入冲突单元测试作为探测器并应用“直到钻取”重抽样机制。通过合成数据与野外数据训练的监控器进行受控比较,我们发现:(1) 基于合成数据的监控器无法泛化到野外钻取;(2) 基于我们“野外”轨迹训练的监控器对未见钻取类型的泛化性更强。我们的结果表明,合成奖励钻取数据可能不完全反映自然奖励钻取行为,仅依赖合成数据的做法可能导致误导性结论。该代码库已公开于 https://github.com/LichenLillc/CoTMonitoring.git
引用
@article{arxiv.2604.23488,
title = {Do Synthetic Trajectories Reflect Real Reward Hacking? A Systematic Study on Monitoring In-the-Wild Hacking in Code Generation},
author = {Lichen Li and Hengguang Zhou and Yijun Liang and Tianyi Zhou and Cho-Jui Hsieh},
journal= {arXiv preprint arXiv:2604.23488},
year = {2026}
}