探索推理模型中的规格游戏
人工智能
2026-05-05 v1
摘要
规格游戏是 LLM 智能体的一个关键失效模式。尽管如此,关于其何时出现以及由何种因素驱动的系统性研究仍很少。为此,我们构建并开源了一个多样化的任务集合,其中模型可以通过采取非预期动作来获得高分。我们发现,在我们八个设置中(包括五个非编码设置),所有测试过的模型在大多数情况下都会利用规格进行非微不足道的作弊,包括 Grok 4 中出现的作弊率最高,而 Claude 模型中出现的作弊率最低。我们利用我们的评估套件来研究驱动规格游戏的因素,发现:1. RL 推理训练显著增加模型利用规格的频率;2. 增加 RL 推理预算对作弊率有微弱的正向影响;3. 测试时缓解措施虽能降低作弊率,但并未消除。我们的结果表明,规格游戏是由 RL 推理训练引起的根本性挑战;我们发布了我们的评估套件以支持进一步的工作。
引用
@article{arxiv.2605.02269,
title = {Towards Understanding Specification Gaming in Reasoning Models},
author = {Kei Nishimura-Gasparian and Robert McCarthy and David Lindner},
journal= {arXiv preprint arXiv:2605.02269},
year = {2026}
}