UrbanVLA:用于城市微运动的视觉-语言-动作模型
机器人学
2025-10-28 v1 人工智能
计算机视觉与模式识别
摘要
城市微运动应用,如配送机器人,要求在大规模城市环境中实现可靠导航,同时遵循长期路径指令。这一任务由于现实世界城市区域的动态和非结构化特性,仍具挑战性,而大多数现有导航方法仍针对短规模和可控场景进行设计。有效的城市微运动需要两种互补的导航技能:如点-目标到达和障碍物规避等低层能力;以及如路径-视觉对齐等高层能力。为此,我们提出 UrbanVLA,一个为可扩展城市导航设计的路由条件视觉-语言-动作 (VLA) 框架。我们的方法在执行过程中显式地将嘈杂的路径waypoint与视觉观察进行对齐,随后规划轨迹以驱动机器人。为使 UrbanVLA 能够掌握两种层级的导航,我们采用两阶段训练流程。首先使用模拟环境和从网页视频中解析的轨迹进行监督式精细调优 (SFT),随后在模拟和真实世界数据的混合物上进行强化学习精细调优 (RFT),以增强模型在真实场景中的安全性和适应性。实验表明,UrbanVLA 在 MetaUrban 上的 SocialNav 任务中相较于强大基准超过 55%。此外,UrbanVLA 实现了可靠的真实世界导航,展示了对大规模城市环境的可扩展性以及对真实世界不确定性的鲁棒性。
引用
@article{arxiv.2510.23576,
title = {UrbanVLA: A Vision-Language-Action Model for Urban Micromobility},
author = {Anqi Li and Zhiyong Wang and Jiazhao Zhang and Minghan Li and Yunpeng Qi and Zhibo Chen and Zhizheng Zhang and He Wang},
journal= {arXiv preprint arXiv:2510.23576},
year = {2025}
}