中文

基于相对预算的强化学习理论:大语言模型推理中的可验证奖励

机器学习 2026-02-03 v1 人工智能 计算与语言

摘要

强化学习(RL)是提高大语言模型推理能力的主导范式,但其效果在不同任务和计算预算之间存在差异。我们提出一种“相对预算”理论,通过一种称为相对预算 ξ:=H/E[T]\xi := H/\mathbb{E}[T] 的单一量来解释这种差异,其中 HH 为生成时域(token 预算),TT 表示在基础策略下直到第一个正确解答所需的 token 数。我们表明 ξ\xi 通过控制奖励方差和信息性轨迹的概率来决定样本效率。我们的分析揭示了三个情形:在“不足”情形 (ξ0\xi \to 0),信息性轨迹稀少,样本复杂度爆炸;在“平衡”情形 (ξ=Θ(1)\xi=\Theta(1)),信息性轨迹以非零概率出现,RL样本效率最大化;在“充足”情形 (ξ\xi \to \infty),学习保持稳定但每次迭代的边际收益递减。我们进一步提供了在线RL的有限样本保证,描述了这些情形下的学习进展。具体而言,在理想分布假设下的案例研究中,我们表明相对预算随迭代线性增长。我们的实证结果在真实场景下确认了这些预测,识别出最大化学习效率的预算 ξ[1.5,2.0]\xi \in [1.5, 2.0],并与最佳推理性能相吻合。

关键词

引用

@article{arxiv.2602.01523,
  title  = {A Relative-Budget Theory for Reinforcement Learning with Verifiable Rewards in Large Language Model Reasoning},
  author = {Akifumi Wachi and Hirota Kinoshita and Shokichi Takakura and Rei Higuchi and Taiji Suzuki},
  journal= {arXiv preprint arXiv:2602.01523},
  year   = {2026}
}

备注

28 pages