中文

PlanU:基于蒙特卡洛树搜索的大语言模型不确定性规划推理

人工智能 2025-11-06 v2

摘要

大型语言模型 (LLM) 正在被广泛应用于各种推理任务。然而,LLM 在处理不确定性下的推理任务时常常表现不佳,这类任务对人类而言相对容易,例如在随机环境中规划行动。LLM 的推理应用受到不确定性挑战的制约,如 LLM 的内部不确定性和环境的不确定性。LLM 的内部不确定性源于其固有的随机抽样过程。大多数基于 LLM 的决策-making (LDM) 方法通过多条推理链或搜索树来解决 LLM 的内部不确定性。然而,这些方法忽略了环境的不确定性,导致在状态转移为随机的环境中表现不佳。一些最近的 LDM 方法通过预测未知变量的概率来处理不确定性,但这些方法不适用于需要与环境交互的多步推理任务。为解决 LLM 决策中的不确定性问题,我们引入PlanU,这是一种基于蒙特卡洛树搜索 (MCTS) 的 LLM 规划方法,能够在 MCTS 中捕捉不确定性。PlanU 将 MCTS 中每个节点的回报建模为分位数分布,该分布使用一组分位数来表示回报分布。为在树搜索中平衡探索与开发,PlanU 引入了带好奇心的上置信度界限 (UCC) 评分,用于估计 MCTS 节点的不确定性。通过大量实验,我们展示了 PlanU 在 LLM 基于不确定性下的推理任务中的有效性。

关键词

引用

@article{arxiv.2510.18442,
  title  = {PlanU: Large Language Model Reasoning through Planning under Uncertainty},
  author = {Ziwei Deng and Mian Deng and Chenjing Liang and Zeming Gao and Chennan Ma and Chenxing Lin and Haipeng Zhang and Songzhu Mei and Siqi Shen and Cheng Wang},
  journal= {arXiv preprint arXiv:2510.18442},
  year   = {2025}
}

备注

38 pages, 19 figures, NeurIPS 2025 Accepted