中文

Motus:统一的潜在动作世界模型

计算机视觉与模式识别 2025-12-29 v2 机器学习 机器人学

摘要

通用具身智能体必须作为一个统一系统运行,然而当前的方法建立在用于理解、世界建模和控制的孤立模型之上。这种碎片化阻碍了多模态生成能力的统一,并妨碍了从大规模、异构数据中学习。本文提出 Motus,一种统一的潜在动作世界模型,它利用现有的通用预训练模型和丰富的、可共享的运动信息。Motus 引入混合 Transformer (Mixture-of-Transformer, MoT) 架构来集成三个专家(即理解、视频生成和动作),并采用 UniDiffuser 风格的调度器,以在不同建模模式(即世界模型、视觉-语言-动作模型、逆动力学模型、视频生成模型和视频-动作联合预测模型)之间实现灵活切换。Motus 进一步利用光流来学习潜在动作,并采用包含三阶段训练流程和六层数据金字塔的方案,从而提取像素级“delta 动作”并实现大规模动作预训练。实验表明,Motus 在仿真(相比 X-VLA 提升 +15%,相比 Pi0.5 提升 +45%)和真实世界场景(提升 +11~48%)中均取得了优于 SOTA 方法的性能,这表明对所有功能和先验进行统一建模能显著有益于下游机器人任务。

关键词

引用

@article{arxiv.2512.13030,
  title  = {Motus: A Unified Latent Action World Model},
  author = {Hongzhe Bi and Hengkai Tan and Shenghao Xie and Zeyuan Wang and Shuhe Huang and Haitian Liu and Ruowen Zhao and Yao Feng and Chendong Xiang and Yinze Rong and Hongyan Zhao and Hanyu Liu and Zhizhong Su and Lei Ma and Hang Su and Jun Zhu},
  journal= {arXiv preprint arXiv:2512.13030},
  year   = {2025}
}