中文

重访 LLM 的树搜索:Gumbel 与顺序二分法实现预算可扩展推理

人工智能 2026-03-24 v1 机器学习

摘要

神经树搜索是一种广泛用于复杂领域(如游戏-playing 和 model-based 强化学习)的决策-making 算法。最近的工作将 AlphaZero-style tree search 应用于增强大型语言模型 (LLM) 在推理期间的推理能力,但我们发现该方法存在 scaling failure:在 GSM8K 和 Game24 上,随着 search budget 的增加,准确率下降。在本文中,我们提出了 ReSCALE,一种改进的 Gumbel AlphaZero MCTS 方法,用 Gumbel sampling 和 Sequential Halving 替代 Dirichlet noise 和 PUCT selection,恢复了单调 scaling,无需更改 model 或其 training。ReSCALE 在 baseline 退步的预算水平上,在 GSM8K 上达到 58.4%,在 Game24 上达到 85.3%。ablation 实验确认 Sequential Halving 是改进的主要驱动力。

关键词

引用

@article{arxiv.2603.21162,
  title  = {Revisiting Tree Search for LLMs: Gumbel and Sequential Halving for Budget-Scalable Reasoning},
  author = {Leonid Ugadiarov and Yuri Kuratov and Aleksandr Panov and Alexey Skrynnik},
  journal= {arXiv preprint arXiv:2603.21162},
  year   = {2026}
}

备注

The paper has been accepted to the ICAPS-2026 conference. 5 pages, 2 figures