突破奖励屏障:通过推测性探索加速思维树推理
机器学习
2026-05-15 v2
摘要
思维树 (ToT) 推理将大语言模型 (LLM) 推理构建为基于树的搜索,展现出解决复杂数学与编程任务的强大潜力。然而,其效率受限于奖励依赖屏障——这是一种由顺序奖励引导的探索所导致的同步瓶颈,它限制了搜索并行度并引入了大量延迟。先前的系统优化主要针对线性思维链 (CoT) 推理设计,无法应对这些挑战,导致 ToT 的效率问题尚待探索。为提升 ToT 推理效率,我们观察到可以推测性地探索推理路径以打破奖励同步屏障。因此,本文提出 SPEX 并引入三项关键技术:(i) 查询内推测性路径选择,用于预测并扩展 ToT 的高潜力分支;(ii) 查询间预算分配,用于动态平衡跨查询的推测性资源分配;(iii) 自适应提前终止,用于修剪倾斜搜索树中深层且冗余的分支。我们在 SGLang 框架之上实现了 SPEX,并在多种 ToT 算法与 LLM 上进行了评估。大量实验表明,SPEX 针对不同 ToT 推理算法实现了 的加速。此外,SPEX 与 token 级推测解码协同工作,实现了高达 的累积加速。消融研究进一步证实了各项技术的贡献。总体而言,SPEX 朝向高效且可扩展的 ToT 推理迈出了重要一步,释放了 LLM 高性能推理期扩展所需的并行性。
引用
@article{arxiv.2605.10195,
title = {Breaking the Reward Barrier: Accelerating Tree-of-Thought Reasoning via Speculative Exploration},
author = {Shuzhang Zhong and Haochen Huang and Shengxuan Qiu and Pengfei Zuo and Runsheng Wang and Meng Li},
journal= {arXiv preprint arXiv:2605.10195},
year = {2026}
}
备注
OSDI 2026