TRAVEL:面向视觉语言导航的无训练检索与对齐
计算机视觉与模式识别
2025-06-11 v2 人工智能
计算与语言
机器学习
机器人学
摘要
本文提出了一种用于视觉语言导航(VLN)任务的模块化方法,通过将问题分解为四个子模块,在零样本设置下利用最先进的大语言模型(LLM)和视觉语言模型(VLM)。给定自然语言导航指令后,我们首先提示LLM提取地标点及其访问顺序。假设已知环境模型,检索最后一个地标点的前k个位置,并基于环境拓扑图使用最短路径算法从起始位置生成到最后一个地标的k条路径假设。每条路径假设由景窗序列表示。随后,我们采用动态规划计算景窗序列与地标名称序列之间的对齐得分,匹配得分来自VLM。最后,计算最高对齐得分假设与实际路径之间的nDTW指标,以评估路径忠实度。我们在复杂的R2R-Habitat指令数据集上证明了相较于使用联合语义图(如VLMaps)的其他方法具有优越性能,并详细量化了视觉 grounding对导航性能的影响。
引用
@article{arxiv.2502.07306,
title = {TRAVEL: Training-Free Retrieval and Alignment for Vision-and-Language Navigation},
author = {Navid Rajabi and Jana Kosecka},
journal= {arXiv preprint arXiv:2502.07306},
year = {2025}
}
备注
Accepted to CVPR 2025 Workshop - Foundation Models Meet Embodied Agents