中文

iMoWM: 控制互动多模态世界模型以驾驭机器人操作

机器人学 2025-10-13 v1

摘要

学习的世界模型在机器人操作中具有巨大的潜力,因为它们可作为真实世界交互的仿真器。尽管在2D视频基础的世界模型方面取得了显著进展,但这些方法往往缺乏几何和空间推理,这对于捕捉3D世界的物理结构至关重要。为此,我们提出iMoWM,这是一种新的交互式世界模型,旨在以自回归方式生成彩色图像、深度图和机械臂掩码,条件化于动作。为克服与三维信息相关的高计算成本,我们提出MMTokenizer,将多模态输入统一编码为紧凑的标记表示。该设计使iMoWM能够利用大规模预训练VideoGPT模型,同时保持高效并融入更丰富的物理信息。凭借其多模态表示,iMoWM不仅提升了未来预测的视觉质量,还可作为基于模型的强化学习(MBRL)的有效仿真器,并促进了现实中的仿射学习。广泛的实验表明,iMoWM在这些任务方面显著优于现有方法,展示了多模态世界建模在机器人操作中的优势。

关键词

引用

@article{arxiv.2510.09036,
  title  = {iMoWM: Taming Interactive Multi-Modal World Model for Robotic Manipulation},
  author = {Chuanrui Zhang and Zhengxian Wu and Guanxing Lu and Yansong Tang and Ziwei Wang},
  journal= {arXiv preprint arXiv:2510.09036},
  year   = {2025}
}