MoWM:通过隐空间到像素特征调制实现具身规划的混合世界模型
计算机视觉与模式识别
2026-02-11 v3
摘要
具身动作规划是机器人学的一项核心挑战,要求模型根据视觉观测和语言指令生成精确动作。尽管视频生成世界模型具有前景,但其对像素级重建的依赖常引入视觉冗余,阻碍了动作解码与泛化。隐空间世界模型提供了紧凑且运动感知的表示,却忽略了对于精确操作至关重要的细粒度细节。为克服这些局限,我们提出了 MoWM,一种融合混合世界模型表示以用于具身动作规划的混合世界模型框架。我们的方法将运动感知的隐空间世界模型特征与像素空间特征相结合,使 MoWM 能够在动作解码时强调与动作相关的视觉细节。在 CALVIN 和真实世界操作任务上的广泛评估表明,我们的方法实现了 SOTA 的任务成功率和卓越的泛化能力。我们还对每个特征空间的优势提供了全面分析,为具身规划的未来研究提供了有价值的见解。代码可在:https://github.com/tsinghua-fib-lab/MoWM 获取。
引用
@article{arxiv.2509.21797,
title = {MoWM: Mixture-of-World-Models for Embodied Planning via Latent-to-Pixel Feature Modulation},
author = {Yangcheng Yu and Xin Jin and Yu Shang and Xin Zhang and Haisheng Su and Wei Wu and Yong Li},
journal= {arXiv preprint arXiv:2509.21797},
year = {2026}
}