中文

GC-VLN:基于图约束的无训练视觉语言导航

机器人学 2025-09-15 v1 计算机视觉与模式识别

摘要

本文提出了一种无需训练的视觉语言导航(VLN)框架。现有零样态VLN方法主要针对离散环境设计,或涉及连续模拟环境中的无监督训练,这使得其在实际场景中的泛化和部署具有挑战性。为实现连续环境下的无训练框架,本研究将导航指导形式化为图约束优化,通过分解指令中的显式空间约束来实现。约束驱动的方法通过约束求解解码空间语义,实现对未见环境的零样态适应。具体而言,我们构建了一个覆盖VLN指令中所有类型空间关系的空间约束库。将人类指令分解为带有路径节点、对象节点和边的有向无环图(DAG),将其用作查询检索库以构建图约束。通过约束求解器求解图约束,以确定路径节点的位置,从而获得机器人的导航路径和最终目标。为处理无解或多解情况,我们构建了导航树和回溯机制。大量实验表明,在标准基准测试上,我们的方法在成功率和导航效率方面显著优于最先进的零样态VLN方法。我们进一步进行了实际场景实验,表明该框架能够有效地泛化到新的环境和指令集合,为更稳健和自主的导航框架铺平了道路。

关键词

引用

@article{arxiv.2509.10454,
  title  = {GC-VLN: Instruction as Graph Constraints for Training-free Vision-and-Language Navigation},
  author = {Hang Yin and Haoyu Wei and Xiuwei Xu and Wenxuan Guo and Jie Zhou and Jiwen Lu},
  journal= {arXiv preprint arXiv:2509.10454},
  year   = {2025}
}

备注

Accepted to CoRL 2025. Project page: [this https URL](https://bagh2178.github.io/GC-VLN/)