VAMOS:面向能力调制与可操控导航的分层视觉-语言-动作模型
机器人学
2025-10-24 v1 人工智能
机器学习
摘要
机器人导航的根本挑战在于学习能跨越多样环境的政策,同时符合特定具象化(embodiment)的独特物理约束和能力(例如,四足机器人可过楼梯,但轮式探测器则不能)。我们提出 VAMOS,一个分层 VLA,解耦语义规划与具象化 grounding:通用规划器从多样化、开放世界数据中学习,而专家 affordance 模型则在安全低成本仿真中学习机器人的物理约束和能力。我们通过仔细设计接口,使高层规划器可直接在图像空间提出候选路径,affordance 模型随后对其进行评估和重新排序。我们的真实世界实验表明,VAMOS 在室内和复杂户外导航中优于 state-of-the-art 基于模型和端到端学习方法。我们还展示了该分层设计使跨具象化导航在四足和轮式机器人之间成为可能,并且可通过自然语言轻松操控。真实世界消除实验确认,专家模型是具象化 grounding 的关键,使单一高层规划器可部署在物理上差异巨大的轮式和四足机器人上。最后,该模型显著提升单机器人可靠性,通过拒绝不可行的计划,实现 3 倍以上的成功率。
引用
@article{arxiv.2510.20818,
title = {VAMOS: A Hierarchical Vision-Language-Action Model for Capability-Modulated and Steerable Navigation},
author = {Mateo Guaman Castro and Sidharth Rajagopal and Daniel Gorbatov and Matt Schmittle and Rohan Baijal and Octi Zhang and Rosario Scalise and Sidharth Talia and Emma Romig and Celso de Melo and Byron Boots and Abhishek Gupta},
journal= {arXiv preprint arXiv:2510.20818},
year = {2025}
}