中文

面向连续环境的约束感知零样图视觉语言导航

机器人学 2025-04-16 v4 计算机视觉与模式识别

摘要

我们解决了在连续环境中的零样视觉语言导航(VLN-CE)任务。零样 VLN-CE 由于缺乏用于训练的专家演示以及对导航指引的环境结构先验信息极其困难。为应对这些挑战,我们提出了约束感知导航器(CA-Nav),将零样 VLN-CE 重新框定为顺序的、约束感知的子指令完成过程。CA-Nav 持续将子指令翻译为导航计划,采用两个核心模块:约束感知子指令管理器(CSM)和约束感知价值映射器(CVM)。CSM 将分解子指令的完成标准定义为约束,并通过约束感知的方式切换子指令来跟踪导航进度。CVM 在 CSM 的约束指导下,动态生成价值图并通过超像素聚类进行细化,以提高导航稳定性。CA-Nav 在两个 VLN-CE 基准测试中实现了最先进的性能,分别在 R2R-CE 和 RxR-CE 的验证未见 split 中的成功率分别提高了 12% 和 13%。此外,CA-Nav 在多种室内场景和指令下展现出在实际机器人部署中的有效性。

关键词

引用

@article{arxiv.2412.10137,
  title  = {Constraint-Aware Zero-Shot Vision-Language Navigation in Continuous Environments},
  author = {Kehan Chen and Dong An and Yan Huang and Rongtao Xu and Yifei Su and Yonggen Ling and Ian Reid and Liang Wang},
  journal= {arXiv preprint arXiv:2412.10137},
  year   = {2025}
}