中文

DUET:基于可验证奖励的强化学习令牌预算分配

机器学习 2026-05-12 v1 人工智能

摘要

基于可验证奖励的强化学习 (RLVR) 每个训练步骤会生成数十万个 token,其中 rollout 生成占计算成本的主导比重。整体 token 预算可在两个主要维度上控制:(i) 决定为哪些提示分配 rollout,(ii) 决定每个 rollout 的长度。 prior工作通常一次仅控制这两个维度中的一个。我们表明,在共享计算预算下联合调优这两个决策可提升推理质量和实际训练时间。我们将这种观点实现为 \textbf{DU}al-controlled tok\textbf{E}n alloca\textbf{T}ion (DUET),这是一种在 GRPO 之上的计算高效层,利用轻量级提示信息预先评估器设置每个提示接收的 rollout 数量,并通过带重要性重加权的标记门控中止规则决定何时停止。 在 MATH 数据集上训练的 Qwen3-1.7B 上,DUET 在性能上优于全预算 GRPO 和其他四个预算感知基线方法。DUET 的优势在数学和编码等其他基准上也能推广,且在科学 Q&A 领域中与最佳基线持平,同时实现 1.62×1.62\times 的实际加速。更值得注意的是,仅使用 50% 的 token 预算,DUET 仍能超越所有基线方法(即使它们使用全预算),实现更高的 2.51×2.51\times 加速。我们在其他主干 LLM(包括 Qwen3-4B 和 Llama-3.2-3B-Instruct)上验证了 DUET 的高性能。值得注意的是,随着预算紧缩,DUET 与最强基线之间的差距反而扩大,这与通常情况下高效方法随计算减少而牺牲质量的常规模式截然不同。更广泛地说,这些结果表明,DUET 的预算感知控制策略不仅有助于加速训练,也有助于提升学习信号的质量。

关键词

引用

@article{arxiv.2605.08441,
  title  = {DUET: Optimize Token-Budget Allocation for Reinforcement Learning with Verifiable Rewards},
  author = {Haoyu Hu and Xuandong Zhao and Xuhai "Orson'' Xu and Nori Jacoby},
  journal= {arXiv preprint arXiv:2605.08441},
  year   = {2026}
}