SPIRAL:基于接地与反思搜索的符号化 LLM 规划
人工智能
2025-12-30 v1 机器学习
多智能体系统
摘要
大型语言模型(LLM)在需要探索和自我纠正的复杂规划任务中常常表现不佳,因为其线性推理过程难以从早期错误中恢复。虽然像蒙特卡洛树搜索(MCTS)这样的搜索算法可以探索替代方案,但在稀疏奖励的引导下往往效果不佳,且未能利用 LLM 丰富的语义能力。我们引入了 SPIRAL(Symbolic LLM Planning via Grounded and Reflective Search,基于接地与反思搜索的符号化 LLM 规划),这是一个将三个专门化 LLM 智能体的认知架构嵌入到 MCTS 循环中的新颖框架。SPIRAL 的关键贡献在于其集成的规划流水线:Planner 提出创造性的下一步,Simulator 通过预测现实结果来接地搜索,而 Critic 通过反思提供密集的奖励信号。这种协同作用将 MCTS 从暴力搜索转变为引导式的、自我纠正的推理过程。在 DailyLifeAPIs 和 HuggingFace 数据集上,SPIRAL 始终优于默认的思维链规划方法和其他最先进的智能体。更重要的是,它大幅超越了其他最先进的智能体;例如,SPIRAL 在 DailyLifeAPIs 上实现了 83.6% 的总体准确率,比次优的搜索框架提高了超过 16 个百分点,同时展示了卓越的 token 效率。我们的工作表明,将 LLM 推理构建为引导式、反思性和接地式的搜索过程,可以产生更鲁棒和高效的自主规划器。源代码、完整附录和所有实验数据均可在官方项目仓库中获取以供复现。
引用
@article{arxiv.2512.23167,
title = {SPIRAL: Symbolic LLM Planning via Grounded and Reflective Search},
author = {Yifan Zhang and Giridhar Ganapavarapu and Srideepika Jayaraman and Bhavna Agrawal and Dhaval Patel and Achille Fokoue},
journal= {arXiv preprint arXiv:2512.23167},
year = {2025}
}