SmartWay:面向零样本视觉语言导航的增强航路点预测与回溯
机器人学
2025-06-18 v2 计算机视觉与模式识别
摘要
视觉语言导航 (VLN) 在连续环境中需要代理人解释自然语言指令,同时在不可约束的 3D 空间中导航。现有 VLN-CE 框架依赖两种阶段的方法:用于生成航路点的航路点预测器和用于执行运动的导航器。然而,当前的航路点预测器在空间感知方面不足,而导航器缺乏历史推理和回溯能力,限制了适应性。我们提出了一个集成增强航路点预测器与基于多模态大语言模型 (MLLM) 的导航器的零样本 VLN-CE 框架。我们的预测器采用更强的视觉编码器、掩码交叉注意力融合,以及基于占据感知的损失以获得更好的航路点质量。导航器包含历史感知推理和自适应路径规划与回溯,提高了鲁棒性。在 R2R-CE 和 MP3D 基准测试上,我们的方法在零样本设置下实现了最先进 (SOTA) 性能,显示出与完全监督方法相当的竞争成绩。Turtlebot 4 的实际世界验证进一步突显了其适应性。
引用
@article{arxiv.2503.10069,
title = {SmartWay: Enhanced Waypoint Prediction and Backtracking for Zero-Shot Vision-and-Language Navigation},
author = {Xiangyu Shi and Zerui Li and Wenqi Lyu and Jiatong Xia and Feras Dayoub and Yanyuan Qiao and Qi Wu},
journal= {arXiv preprint arXiv:2503.10069},
year = {2025}
}
备注
Accepted by IROS 2025. Project website: https://sxyxs.github.io/smartway/