RoboTron-Mani: 用于机器人操作的全能多模态大模型
机器人学
2025-11-05 v2 多媒体
摘要
最近,机器人学通过更大模型与大规模数据集的集成取得了显著进展。然而,将这些模型应用于三维空间交互以及管理数据采集成本方面仍存在挑战。为了解决这些问题,我们提出了多模态机器人操作模型 RoboTron-Mani 以及综合数据集 RoboData。RoboTron-Mani 一方面通过相机参数与占据监督增强了三维感知。另一方面,它进一步基于 OpenFlamingo 引入了模态隔离掩码(Modality-Isolation-Mask)与多模态解码器模块,改进了模态融合与细粒度感知。RoboData 整合了多个公开可用数据集,实现了多视角图像、相机参数、深度图、动作与空间对齐的首次融合,促进了来自多样化机器人数据集的全面学习,并提供了一个完整的评估系统。基于 RoboData 训练的 RoboTron-Mani 是首个超越专家模型的通用策略,能够同时跨多个数据集评估所有任务,而非局限于特定的数据或任务选择。具体而言,RoboTron-Mani 通过将 CALVIN 上的平均序列长度从 1.7 提升至 3.5 来增强操作性能,实现了跨具身泛化,并在模拟与真实世界数据集上取得了最先进的成果。
引用
@article{arxiv.2412.07215,
title = {RoboTron-Mani: All-in-One Multimodal Large Model for Robotic Manipulation},
author = {Feng Yan and Fanfan Liu and Liming Zheng and Yufeng Zhong and Yiyang Huang and Zechao Guan and Chengjian Feng and Lin Ma},
journal= {arXiv preprint arXiv:2412.07215},
year = {2025}
}