中文

PAC-MCTS: 面向稳健 LLM 指导搜索与规划的偏差感知修剪

机器学习 2026-05-12 v3 人工智能 机器学习

摘要

在自主推理与具身规划中,随着搜索深度的增加,候选动作空间会呈指数级扩张,常常耗尽计算预算。虽然启发式修剪是关键的权衡手段,但现有方法在以大语言模型(LLM)等代理评估器指导下时缺乏形式化的安全保证,因为后者存在系统性偏差。我们将节点扩展建模为受限偏差 LL 下的局部最优臂识别(Best-Arm Identification, BAI)问题,推导出样本复杂度上界为 O((Δ4L)2)\mathcal{O}((\Delta-4L)^{-2}),识别出 Δ>4L\Delta > 4L 作为安全消除可行的条件。进一步建立信息论下界 Ω((Δ2L)2)\Omega((\Delta-2L)^{-2}),刻画偏性探索的结构极限。基于这些结果,我们提出 PAC-MCTS 框架,通过动态调整置信区间实现偏差感知修剪。实验在 Blocksworld 和 ALFWorld 上表明,PAC-MCTS 在强修剪基线上显著提升鲁棒性和搜索效率,在严格计算预算下实现最高达 78% 的 API 调用减少,以及 3 倍以上的样本效率。消融实验进一步验证了随评估器偏差增加而导致性能下降的预测行为。

关键词

引用

@article{arxiv.2604.14345,
  title  = {PAC-MCTS: Bias-Aware Pruning for Robust LLM-Guided Search and Planning},
  author = {Tianhao Qian},
  journal= {arXiv preprint arXiv:2604.14345},
  year   = {2026}
}

备注

18 pages, 4 figures