MM-ACT:利用多模态并行生成学习行为
计算机视觉与模式识别
2025-12-09 v2 机器学习
机器人学
摘要
通用机器人策略既需要语义理解以进行任务规划,也需要通过预测能力与环境进行交互。为此,我们提出 MM-ACT,一个统一的视觉语言动作(VLA)模型,将文本、图像和动作整合到共享 token 空间中,并在所有三个模态上进行生成。MM-ACT 采用文本和图像生成的重新遮蔽并行解码策略,采用动作生成的单步并行解码策略以提高效率。我们引入 Context-Shared Multimodal Learning,即一种统一的训练范式,从共享上下文中对所有三个模态的生成进行监督,通过跨模态学习增强动作生成。我们在 LIBERO simulation 和 Franka 实机 setup 以及 RoboTwin2.0 上进行实验,以分别评估域内和域外性能。我们的方法在 LIBERO 上达到了 96.3% 的成功率,在真实 Franka 上实现了三个任务的 72.0% 成功率,在 RoboTwin2.0 上实现了八个双手任务的 52.38% 成功率,并通过跨模态学习获得了额外的 9.25% 提升。我们将发布代码、模型和数据至 https://github.com/HHYHRHY/MM-ACT。
引用
@article{arxiv.2512.00975,
title = {MM-ACT: Learn from Multimodal Parallel Generation to Act},
author = {Haotian Liang and Xinyi Chen and Bin Wang and Mingkang Chen and Yitian Liu and Yuhao Zhang and Zanxin Chen and Tianshuo Yang and Yilun Chen and Jiangmiao Pang and Dong Liu and Xiaokang Yang and Yao Mu and Wenqi Shao and Ping Luo},
journal= {arXiv preprint arXiv:2512.00975},
year = {2025}
}
备注
17 pages