中文

GA-VLN:基于几何感知 BEV 表示的高效视觉语言导航

计算机视觉与模式识别 2026-05-22 v1 人工智能

摘要

尽管视觉语言导航 (VLN) 取得了显著进展,现有方法仍依赖稠密 RGB 视频,产生大量 patch tokens且缺乏显式的空间结构,导致计算开销大且空间推理受限。为此,我们提出 Geometry-Aware BEV (GA-BEV) —— 一种紧凑的、3D grounding 的特征表示,集成了显式和隐式的几何线索到基于多模态大语言模型 (MLLM) 的导航系统。我们通过将视觉特征投影到 3D 空间并聚合到代理中心布局中构建 BEV 空间图,保留几何一致性同时减少 token 冗余。为进一步丰富几何理解,我们将来自预训练 3D 基础模型的特征注入 BEV 空间,注入源自大规模 3D 重建任务中学习的结构先验。正是这些互补线索 —— 显式基于深度的投影和隐式学习的先验 —— 产生紧凑且空间表达丰富的表示,显著提升导航效率和性能。实验表明,我们的方法仅使用导航数据即可实现最先进的结果,无需 DAgger 数据增强或混合 VQA 训练,展示了 GA-VLN 框架的鲁棒性和数据效率。

关键词

引用

@article{arxiv.2605.22036,
  title  = {GA-VLN: Geometry-Aware BEV Representation for Efficient Vision-Language Navigation},
  author = {Jiahao Yang and Zihan Wang and Xiangyang Li and Xing Zhu and Yujun Shen and Yinghao Xu and Shuqiang Jiang},
  journal= {arXiv preprint arXiv:2605.22036},
  year   = {2026}
}