中文

NavOne:基于俯视图的视觉语言导航一步全局规划

计算机视觉与模式识别 2026-05-19 v3 人工智能

摘要

现有的视觉语言导航 (VLN) 方法通常采用以自我为中心的逐步范式,这难以应对误差累积并限制了效率。虽然最近的方法试图利用预先构建的环境地图,但它们通常依赖于增量更新记忆图或对离散路径提案进行评分,这限制了连续的空间推理并造成了离散瓶颈。我们提出了俯视 VLN (TD-VLN),在我们新构建的 R2R-TopDown 数据集的支持下,将导航重新表述为在预先构建的俯视图上的一步全局路径规划问题。为了解决这个问题,我们引入了 NavOne,这是一个统一的框架,在单次端到端前向传递中直接预测多模态地图上的密集路径概率。NavOne 具有一个用于联合多模态地图表示的俯视图融合器,并扩展了注意力残差以实现具有空间感知的深度混合。在 R2R-TopDown 上的大量实验表明,NavOne 在基于地图的 VLN 方法中实现了 SOTA 性能,其规划阶段速度比现有的基于地图的基线快 8 倍,比以自我为中心的方法快 80 倍,从而实现了高效的全局导航。

关键词

引用

@article{arxiv.2605.06317,
  title  = {NavOne: One-Step Global Planning for Vision-Language Navigation on Top-Down Maps},
  author = {Dijia Zhan and Jinyi Li and Chenxi Zheng and Shaoyu Huang and Yong Li and Jie Tang and Xuemiao Xu},
  journal= {arXiv preprint arXiv:2605.06317},
  year   = {2026}
}

备注

10 pages, 7 figures