中文

OmniVLA:一种用于机器人导航的全模态视觉-语言-动作模型

机器人学 2025-09-25 v1 机器学习

摘要

人类在导航至目的地时,可以灵活地解释和组合不同的目标规范,例如语言指令、空间坐标或视觉参考。相比之下,大多数现有的机器人导航策略仅在单一模态上训练,这限制了它们对现实世界场景的适应性,在这些场景中,不同形式的目标规范是自然且互补的。在这项工作中,我们提出了一个用于机器人基础模型的训练框架,该框架能够为基于视觉的导航实现全模态目标条件化。我们的方法利用一个高容量的视觉-语言-动作(VLA)骨干网络,并通过一种随机化的模态融合策略,使用三种主要目标模态进行训练:2D 位姿、第一人称图像和自然语言,以及它们的组合。这种设计不仅扩大了可用数据集的池,还鼓励策略发展更丰富的几何、语义和视觉表征。由此产生的模型 OmniVLA,实现了对未见环境的强大泛化能力、对稀缺模态的鲁棒性,以及遵循新颖自然语言指令的能力。我们证明,OmniVLA 在跨模态任务上优于专家基线模型,并为微调以适应新模态和任务提供了灵活的基础。我们相信,OmniVLA 朝着广泛泛化和灵活的导航策略迈出了一步,并为构建全模态机器人基础模型提供了一条可扩展的路径。我们展示了展示 OmniVLA 性能的视频,并将在我们的项目页面上发布其检查点和训练代码。

关键词

引用

@article{arxiv.2509.19480,
  title  = {OmniVLA: An Omni-Modal Vision-Language-Action Model for Robot Navigation},
  author = {Noriaki Hirose and Catherine Glossop and Dhruv Shah and Sergey Levine},
  journal= {arXiv preprint arXiv:2509.19480},
  year   = {2025}
}

备注

9 pages, 7 figures, 6 tables