慢地面,快速移动:面向通用视觉语言导航的双系统基础模型
机器人学
2025-12-10 v1
摘要
虽然最近的大型视觉语言模型(VLM)在视觉语言导航(VLN)中提升了泛化能力,但现有方法通常依赖将视觉语言输入直接映射到短程离散动作的端到端管道。此类设计常导致运动碎片化、延迟高昂,以及在动态障碍规避等现实挑战方面表现不足。我们提出 DualVLN,这是首个双系统 VLN 基础模型,通过高级推理与低级动作执行的协同集成,实现了鲁棒的实时控制与复杂动态环境中的自适应局部决策。系统 2 基于 VLM 的全局规划器,通过图像 grounding 推断中期路标目标("慢慢地面")。系统 1 则是一个轻量级、多模态条件扩散 Transformer 策略,利用显式像素目标和系统 2 的潜在特征生成平滑且精确的轨迹("快速移动")。双系统设计实现了训练解耦,使 VLM 保持其泛化能力,而系统 1 获得可解释且有效的局部导航。DualVLN 在所有 VLN 基准测试及实际实验中均优于先前方法,证明了其在动态环境中的稳健长程规划与实时适应性。
引用
@article{arxiv.2512.08186,
title = {Ground Slow, Move Fast: A Dual-System Foundation Model for Generalizable Vision-and-Language Navigation},
author = {Meng Wei and Chenyang Wan and Jiaqi Peng and Xiqian Yu and Yuqiang Yang and Delin Feng and Wenzhe Cai and Chenming Zhu and Tai Wang and Jiangmiao Pang and Xihui Liu},
journal= {arXiv preprint arXiv:2512.08186},
year = {2025}
}