三步导航:面向零样本视觉语言导航的层次化全局-局部规划器
计算机视觉与模式识别
2026-04-30 v1 机器人学
摘要
通过使用多模态大语言模型(MLLMs)实现了对未知环境中基于视觉的导航的突破性进展。这些模型能够通过评估每个时间步骤上的当前视图与给定任务和目标之间的关系来规划一系列运动。然而,当前由 MLLM 支撑的零样本视觉语言导航(VLN)代理仍倾向于偏离路径、提前停止,并实现较低的整体成功率。我们提出的三步导航通过三视图协议来抵消这些问题:首先,“向前查看”提取全局地标并绘制粗略计划;然后,“当前查看”将当前视觉观察与下一个子目标对齐以实现精细引导;最后,“向后查看”审计整个轨迹以纠正停止前的累积漂移。我们的规划器无需梯度更新或任务特定的微调,即可以最小的开销集成到现有的 VLN 流水线中。三步导航在 R2R-CE 和 RxR-CE 数据集上实现了零样本状态的最佳性能。我们的代码已公开于 https://github.com/ZoeyZheng0/3-step-Nav。
引用
@article{arxiv.2604.26946,
title = {Three-Step Nav: A Hierarchical Global-Local Planner for Zero-Shot Vision-and-Language Navigation},
author = {Wanrong Zheng and Yunhao Ge and Laurent Itti},
journal= {arXiv preprint arXiv:2604.26946},
year = {2026}
}
备注
Accepted to AISTATS 2026. Code: https://github.com/ZoeyZheng0/3-step-Nav