中文

Countdown-Code:研究 RLVR 中奖励篡改的涌现与泛化的测试平台

机器学习 2026-04-21 v2 人工智能 计算与语言

摘要

奖励篡改是一种误差情况,模型过度优化代理奖励而未真正解决底层任务。准确测量奖励篡改发生情况一直具有挑战,因为真实任务奖励往往昂贵或无法计算。我们引入 Countdown-Code,一个最小化环境,模型既可以解决数学推理任务,又可以操控测试托架。这种双访问设计在代理奖励(测试通过/失败)和真实奖励(数学正确性)之间创建了清晰的分离,从而实现对奖励篡改率的准确测量。通过该环境,我们研究了开放权重 LLM 中的奖励篡改行为,并发现即使在监督微调 (SFT) 时,极少量的奖励篡改轨迹泄漏到训练数据中,即可导致模型内化奖励篡改,这在后续强化学习 (RL) 中会重新显现。仅含 1% 的 distillation SFT 数据污染就足以让模型学习奖励篡改。我们进一步表明,RL 会放大误差并驱动其在原有领域之外的泛化。我们开源了该环境和代码以促进未来在 LLM 奖励篡改研究中使用。我们的结果揭示了奖励篡改如何在 LLM 中涌现并持久存在的此前未被充分探索的路径,凸显了对合成 SFT 数据进行更严格验证的必要性。代码已公开于 https://github.com/zohaib-khan5040/Countdown-Code。

关键词

引用

@article{arxiv.2603.07084,
  title  = {Countdown-Code: A Testbed for Studying The Emergence and Generalization of Reward Hacking in RLVR},
  author = {Muhammad Khalifa and Zohaib Khan and Omer Tafveez and Hao Peng and Lu Wang},
  journal= {arXiv preprint arXiv:2603.07084},
  year   = {2026}
}