GC-VLN:基于图约束的无训练视觉语言导航
机器人学
2025-09-15 v1 计算机视觉与模式识别
摘要
本文提出了一种无需训练的视觉语言导航(VLN)框架。现有零样态VLN方法主要针对离散环境设计,或涉及连续模拟环境中的无监督训练,这使得其在实际场景中的泛化和部署具有挑战性。为实现连续环境下的无训练框架,本研究将导航指导形式化为图约束优化,通过分解指令中的显式空间约束来实现。约束驱动的方法通过约束求解解码空间语义,实现对未见环境的零样态适应。具体而言,我们构建了一个覆盖VLN指令中所有类型空间关系的空间约束库。将人类指令分解为带有路径节点、对象节点和边的有向无环图(DAG),将其用作查询检索库以构建图约束。通过约束求解器求解图约束,以确定路径节点的位置,从而获得机器人的导航路径和最终目标。为处理无解或多解情况,我们构建了导航树和回溯机制。大量实验表明,在标准基准测试上,我们的方法在成功率和导航效率方面显著优于最先进的零样态VLN方法。我们进一步进行了实际场景实验,表明该框架能够有效地泛化到新的环境和指令集合,为更稳健和自主的导航框架铺平了道路。
引用
@article{arxiv.2509.10454,
title = {GC-VLN: Instruction as Graph Constraints for Training-free Vision-and-Language Navigation},
author = {Hang Yin and Haoyu Wei and Xiuwei Xu and Wenxuan Guo and Jie Zhou and Jiwen Lu},
journal= {arXiv preprint arXiv:2509.10454},
year = {2025}
}
备注
Accepted to CoRL 2025. Project page: [this https URL](https://bagh2178.github.io/GC-VLN/)