深度-宽度协同效应:通过自适应探索解锁 LLM 推理潜力
机器学习
2026-04-14 v8 人工智能
摘要
强化学习可验证奖励(RLVR)是增强大型语言模型(LLM)推理能力的强大方法,但其潜力受限于两个关键领域的探索不足:深度(问题难度)和宽度(训练实例数量)。我们的分析表明,流行的 GRPO 算法存在偏差,导致对难以解决且准确率低的难题被低估,这些问题对于提高推理技巧至关重要。为此,我们引入难度自适应 rollout 采样(DARS),一种通过有针对性的多阶段 rollout 来重新加权难题的方法。DARS 根据我们提出的再平衡计划增加这些更难问题的 rollout 结果数量,导致在 Pass@K 指标上实现持续的性能提升。我们发现,仅增加 rollout 大小并不能提高性能,反而可能损害性能。相比之下,通过扩大 batch size 来增加宽度的全批次更新显著提升了 Pass@1 指标。这一改进源于更高的 token 级别熵,确保了稳健的探索并最小化了梯度噪声。我们进一步提出了 DARS-Breadth 结合方法,将 DARS 与大规模训练数据的宽度相结合。该方法在 Pass@K 和 Pass@1 两个指标上均实现同步提升,证明深度(自适应探索)和宽度(扩大迭代实例)是解锁 RLVR 完全潜力的正交且互补的维度。
引用
@article{arxiv.2508.13755,
title = {Depth-Breadth Synergy in RLVR: Unlocking LLM Reasoning Gains with Adaptive Exploration},
author = {Zhicheng Yang and Zhijiang Guo and Yinya Huang and Yongxin Wang and Dongchun Xie and Hanhui Li and Yiwei Wang and Xiaodan Liang and Jing Tang},
journal= {arXiv preprint arXiv:2508.13755},
year = {2026}
}
备注
20 pages, 17 figures