中文

每一次 rollout 都重要:高效测试时扩展的最优资源分配

机器学习 2025-10-21 v2 人工智能

摘要

测试时扩展(TTS)通过使用额外的推理计算资源来探索多个推理路径,从而提高大语言模型(LLM)的性能。然而,如何在搜索过程中有效分配固定的 rollout 预算仍未得到充分探索,常导致计算资源的低效使用。在本工作中,我们将测试时搜索问题形式化为资源分配问题,推导出在固定 rollout 预算下最大化获取正确解答概率的最优分配策略。在此框架下,我们揭示了现有搜索方法的核心局限性:解决方案级分配倾向于偏好拥有更多候选者的推理方向,导致理论上次优和低效的计算资源使用。为此,我们提出了方向导向资源分配(DORA),这是一种可证明最优的方法,通过解耦方向质量与候选者数量,在方向级别上分配资源以缓解此偏差。为展示 DORA 的有效性,我们在包括 MATH500、AIME2024 和 AIME2025 等具有挑战性的数学推理基准测试上进行了广泛实验。实验结果表明,DORA 在计算成本相当的情况下持续优于强大基线,实现了最先进的准确率。我们希望我们的发现有助于更深入地理解大语言模型测试时扩展的最优策略。

关键词

引用

@article{arxiv.2506.15707,
  title  = {Every Rollout Counts: Optimal Resource Allocation for Efficient Test-Time Scaling},
  author = {Xinglin Wang and Yiwei Li and Shaoxiong Feng and Peiwen Yuan and Yueqi Zhang and Jiayi Shi and Chuyi Tan and Boyuan Pan and Yao Hu and Kan Li},
  journal= {arXiv preprint arXiv:2506.15707},
  year   = {2025}
}

备注

Accepted at NeurIPS2025