固定 token 预算下树搜索策略的对齐:LLM 测试时扩展中的应用
计算与语言
2026-02-11 v1 人工智能
机器学习
摘要
树搜索解码是大型语言模型(LLM)测试时扩展的有效方法,但实际部署受限于固定的查询 token 预算,这种预算在不同场景下会有所不同。现有的树搜索策略大多不考虑预算,仅将其视为终止条件,可能导致后期过度分枝或提前终止。我们提出了 {基于预算的蒙特卡洛树搜索}(BG-MCTS),一种在搜索策略上与剩余 token 预算一致的树搜索解码算法:它首先进行广泛的探索,然后在预算耗尽时优先进行细化和答案完成,同时减少浅层节点的后期分枝。BG-MCTS 在 MATH500 和 AIME24/25 不同预算下的开源 LLM 上 consistently 优于预算不敏感的树搜索基线。
引用
@article{arxiv.2602.09574,
title = {Aligning Tree-Search Policies with Fixed Token Budgets in Test-Time Scaling of LLMs},
author = {Sora Miyamoto and Daisuke Oba and Naoaki Okazaki},
journal= {arXiv preprint arXiv:2602.09574},
year = {2026}
}