中文

WorldPlanner:基于蒙特卡洛树搜索与模型预测控制的动作条件视觉世界模型

机器人学 2025-11-06 v1

摘要

机器人需要从原始感官输入中理解其所处环境,并对其行为后果进行推理,以完成复杂任务。行为克隆(Behavior Cloning, BC)利用任务相关的人类示教数据,将这些知识学得为端到端策略。然而,此类策略难以迁移到新任务,且生成训练数据颇具挑战,因为这需要精细的示教与频繁的环境复位。与这种基于策略的视角不同,本文采用基于模型的方法:我们采集若干小时易于收集的非结构化游戏数据,用于学习一个动作条件视觉世界模型、一个基于扩散模型的动作采样器,以及可选的奖励模型。该世界模型与动作采样器及奖励模型相结合,被用于通过蒙特卡洛树搜索(MCTS)规划器优化长序列动作。所得规划结果通过零阶模型预测控制器(MPC)在机器人上执行。我们表明,动作采样器缓解了规划过程中世界模型的幻觉问题,并在三项具有不同规划与建模复杂度的真实机器人任务上验证了我们的方法。实验结果支持如下假设:相较于 BC 基线,规划在标准操控测试环境中带来了显著的性能提升。

关键词

引用

@article{arxiv.2511.03077,
  title  = {WorldPlanner: Monte Carlo Tree Search and MPC with Action-Conditioned Visual World Models},
  author = {R. Khorrambakht and Joaquim Ortiz-Haro and Joseph Amigo and Omar Mostafa and Daniel Dugas and Franziska Meier and Ludovic Righetti},
  journal= {arXiv preprint arXiv:2511.03077},
  year   = {2025}
}