Pass@k 训练:适用于大规模推理模型的探索与开发采取的自适应平衡
机器学习
2025-08-15 v1 人工智能
计算与语言
摘要
可验证奖励的强化学习(RLVR)通常采用 Pass@1 作为奖励,面临在平衡探索与开发方面的问题,导致策略偏好保守动作,收敛于局部最优。因此,识别合适的奖励度量标准至关重要。虽然已有工作在评估中使用了 Pass@k,但其与 LLM 在 RLVR 中探索能力的联系仍基本被忽视。为调查此问题,我们首先将 Pass@k 作为奖励来训练策略模型(即“Pass@k 训练”),并观察到其探索能力的提升。随后,我们推导出 Pass@k 训练优势的解析解,从而实现高效且有效的过程。基于此,我们的分析表明,探索与开发并非固有的冲突目标,反而可以相互增强。此外,Pass@k 训练本质上涉及直接设计优势函数。灵感来自于此,我们初步探索了 RLVR 的优势函数设计,取得鼎舞结果,凸显了潜在的未来方向。
引用
@article{arxiv.2508.10751,
title = {Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models},
author = {Zhipeng Chen and Xiaobo Qin and Youbin Wu and Yue Ling and Qinghao Ye and Wayne Xin Zhao and Guang Shi},
journal= {arXiv preprint arXiv:2508.10751},
year = {2025}
}
备注
Technical Report about RLVR: 32 pages, 18 figures, 7 tables