RoboMamba: 高效视觉-语言-动作机器人模型
计算机视觉与模式识别
2024-12-17 v2
摘要
机器人操控的基本目标是使模型能够理解视觉场景并执行动作。虽然现有的视觉-语言-动作 (VLA) 模型可以处理各种基础任务,但仍面临两个挑战:(1) 针对复杂任务的推理能力不足,(2) VLA 模型微调和推理的计算成本高。最近提出的状态空间模型 (SSM) 称为 Mamba 在非平凡序列建模方面展现出具有线性推理复杂度的潜力。灵感来自此, 我们引入 RoboMamba—a 一个利用 Mamba 实现机器人推理和动作能力的端到端 VLA 模型,同时保持高效的微调和推理。具体而言,我们首先将视觉编码器与 Mamba 集成,通过共训练将视觉标记与语言嵌入对齐,使我们的模型具备视觉常识和机器人相关推理能力。为进一步赋予 RoboMamba SE(3) 位姿预测能力,我们探索了一种高效微调策略,即添加简单的策略头。我们发现,一旦 RoboMamba 具备足够的推理能力,就可以通过最小的微调参数(仅为模型的 0.1%)和时间来获得操控技能。在实验中,RoboMamba 在通用和机器人评估基准上展现出卓越的推理能力。同时,我们的模型在仿真和真实世界实验中展示了惊人的位姿预测效果,推理速度比现有 VLA 模型快 3 倍。我们的项目网页: https://sites.google.com/view/robomamba-web
引用
@article{arxiv.2406.04339,
title = {RoboMamba: Efficient Vision-Language-Action Model for Robotic Reasoning and Manipulation},
author = {Jiaming Liu and Mengzhen Liu and Zhenyu Wang and Pengju An and Xiaoqi Li and Kaichen Zhou and Senqiao Yang and Renrui Zhang and Yandong Guo and Shanghang Zhang},
journal= {arXiv preprint arXiv:2406.04339},
year = {2024}
}
备注
Accepted by Neurips 2024