减少推理、提高效率:预算感知价值树搜索用于 LLM 智能体
机器学习
2026-03-16 v1 人工智能
摘要
测试时规模化已成为提高 LLM 智能体可靠性的主导范式,但现有方法将计算资源视为充足的资源,使智能体在冗余步骤或死路分支上耗尽 token 和工具预算。现有的预算感知方法要么需要昂贵的微调,要么依赖基于轨迹的粗糙启发式方法,无法在执行中进行干预。我们提出了预算感知价值树(BAVT),这是一种训练-free 的推理时框架,将多跳推理建模为由步骤级别价值估计引导的动态搜索树。我们的另一个关键创新是一种预算条件节点选择机制,该机制将剩余资源比例作为节点价值的自然缩放指数,提供了从广泛探索到保守利用的原则性、无参数的过渡,随着预算耗尽。为 combat 已知的 LLM 自评估定信念,我们采用残差价值预测器,对相对进展进行评分,而非绝对状态质量,从而实现对无信息或冗余工具调用的可靠修剪。我们进一步提供了理论收敛保证,证明 BAVT 在明确的有限预算下以至少 的概率到达终端答案。对四个多跳 QA 基准测试进行广泛评估,结果显示 BAVT 在两个模型系列中均一致优于并行抽样基线。最显著的是,在严格的低预算约束下,BAVT 的表现甚至超过基线的 4 倍资源配置,证明了智能的预算管理远胜于蛮力计算规模化。
引用
@article{arxiv.2603.12634,
title = {Spend Less, Reason Better: Budget-Aware Value Tree Search for LLM Agents},
author = {Yushu Li and Wenlong Deng and Jiajin Li and Xiaoxiao Li},
journal= {arXiv preprint arXiv:2603.12634},
year = {2026}
}