MM-Nav:基于多专家学习的多视角 VLA 模型用于鲁棒视觉导航
机器人学
2025-10-06 v1 计算机视觉与模式识别
摘要
视觉导航策略被视为一个有前景的方向,因为其模仿人类通过使用egocentric视觉观察进行导航。然而,视觉观察的光学信息难以像激光点云或深度图那样被显式建模,这随后需要智能模型和大规模数据。为此,我们提出利用视觉-语言-动作(VLA)模型从合成专家数据中以教师-学生方式学习多样化的导航能力。具体而言,我们将 VLA 模型 MM-Nav 实现为基于预训练大型语言模型和视觉基础模型的多视角 VLA(支持360度观察)。对于大规模导航数据,我们从三个在具有特权深度信息的三个具有挑战性、针对不同导航能力(到达、压缩、规避)设计的环境中收集三个强化学习(RL)专家的数据。我们使用来自 RL 专家收集的在线数据迭代训练 VLA 模型,其中训练比例根据各能力的表现动态平衡。通过合成环境中的大量实验,我们证明该模型具有强大的泛化能力。此外,我们发现我们的学生 VLA 模型甚至超过 RL 教师,显示了整合多种能力的协同效应。广泛的实际实验进一步确认了我们方法的有效性。
引用
@article{arxiv.2510.03142,
title = {MM-Nav: Multi-View VLA Model for Robust Visual Navigation via Multi-Expert Learning},
author = {Tianyu Xu and Jiawei Chen and Jiazhao Zhang and Wenyao Zhang and Zekun Qi and Minghan Li and Zhizheng Zhang and He Wang},
journal= {arXiv preprint arXiv:2510.03142},
year = {2025}
}
备注
Project page: https://pku-epic.github.io/MM-Nav-Web/