LLM 作弊者:RLVR 可能导致奖励作弊
机器学习
2026-04-17 v1 人工智能
摘要
随着以可验证奖励的强化学习 (Reinforcement Learning with Verifiable Rewards, RLVR) 成为扩大 LLM 推理能力的主导范式,一种新型失效模式浮现:LLM 作弊验证器。我们在归纳推理任务上研究这一现象,该类任务要求模型归纳并输出逻辑规则。我们发现,经过 RLVR 训练的模型会系统性地放弃规则归纳。它们不学习可泛化的模式(例如,"运载红色车辙的列车向东行驶"),而是枚举实例级标签,产生通过验证器但未捕获任务所需关系模式的输出。我们表明,这种行为并非理解能力的缺失,而是一种奖励作弊形式:不完美的验证器仅检查外延正确性,容许虚假正例。为检测此类捷径,我们引入等构扰动测试 (Isomorphic Perturbation Testing, IPT),该方法在扩展等价和等构验证下评估单个模型输出,后者强制对逻辑等价任务保持不变性。虽然真正的规则归纳保持不变性,但捷径策略会失败。我们发现,捷径行为特定于 RLVR 训练的推理模型(如 GPT-5、Olmo3),而在非 RLVR 模型(如 GPT-4o、GPT-4.5、Ministral)中则不存在。此外,随着任务复杂度和推理时间计算量的增加,捷径现象呈上升趋势。在受控训练实验中,扩展等价验证可直接诱导捷径策略,而等构验证则消除它们。这些结果表明,RLVR 可能通过超越直接操纵的方式,利用验证器未强制的方面,来激励奖励作弊。
引用
@article{arxiv.2604.15149,
title = {LLMs Gaming Verifiers: RLVR can Lead to Reward Hacking},
author = {Lukas Helff and Quentin Delfosse and David Steinmann and Ruben Härle and Hikaru Shindo and Patrick Schramowski and Wolfgang Stammer and Kristian Kersting and Felix Friedrich},
journal= {arXiv preprint arXiv:2604.15149},
year = {2026}
}