激励机制下的积分榜:战略后训练下的模型排名
计算机科学与博弈论
2026-03-10 v1 机器学习
摘要
有影响力的基准测试激励竞争性模型开发者在积分榜上战略性地分配后训练资源,以提高性能,被称为“benchmaxxing”或“训练在测试任务上”。本文启动了对激励结构的原则性研究。我们将基准测试建模为一个栈尔沃斯游戏,基准设计者选择评估方案,多个模型开发者在给定设计者选择后的子游戏中同时竞争。每个竞争者都有一个未知潜在质量的模型, can 通过分配资源来 inflate its observed score。首先,我们证明当前的基准测试诱导的游戏中,模型开发者之间不存在纳什均衡。这一结果为当前实践导致不对齐激励的原因提供了解释,促使模型开发者以不透明的方式进行策略性思考。然而,我们证明,在 mild 条件下,最近提出的评估协议(称为 tune-before-test)诱导的基准具有唯一的纳什均衡,能够按潜在质量对模型进行排名。这一积极结果表明,基准测试不必设置差的激励机制,即便当前评估确实如此。
关键词
引用
@article{arxiv.2603.08371,
title = {Leaderboard Incentives: Model Rankings under Strategic Post-Training},
author = {Yatong Chen and Guanhua Zhang and Moritz Hardt},
journal= {arXiv preprint arXiv:2603.08371},
year = {2026}
}