基于相对预算的强化学习理论:大语言模型推理中的可验证奖励
机器学习
2026-02-03 v1 人工智能
计算与语言
摘要
强化学习(RL)是提高大语言模型推理能力的主导范式,但其效果在不同任务和计算预算之间存在差异。我们提出一种“相对预算”理论,通过一种称为相对预算 的单一量来解释这种差异,其中 为生成时域(token 预算), 表示在基础策略下直到第一个正确解答所需的 token 数。我们表明 通过控制奖励方差和信息性轨迹的概率来决定样本效率。我们的分析揭示了三个情形:在“不足”情形 (),信息性轨迹稀少,样本复杂度爆炸;在“平衡”情形 (),信息性轨迹以非零概率出现,RL样本效率最大化;在“充足”情形 (),学习保持稳定但每次迭代的边际收益递减。我们进一步提供了在线RL的有限样本保证,描述了这些情形下的学习进展。具体而言,在理想分布假设下的案例研究中,我们表明相对预算随迭代线性增长。我们的实证结果在真实场景下确认了这些预测,识别出最大化学习效率的预算 ,并与最佳推理性能相吻合。
引用
@article{arxiv.2602.01523,
title = {A Relative-Budget Theory for Reinforcement Learning with Verifiable Rewards in Large Language Model Reasoning},
author = {Akifumi Wachi and Hirota Kinoshita and Shokichi Takakura and Rei Higuchi and Taiji Suzuki},
journal= {arXiv preprint arXiv:2602.01523},
year = {2026}
}
备注
28 pages