中文

Fast-SmartWay:无全景的端到端零样本视觉与语言导航

机器人学 2025-11-04 v1 计算机视觉与模式识别

摘要

连续环境中的视觉与语言导航(VLN-CE)的最新进展已利用多模态大语言模型(MLLM)实现了零样本导航。然而,现有方法通常依赖于全景观测和涉及航点预测器的两阶段流程,这引入了显著的延迟并限制了实际应用性。在这项工作中,我们提出了Fast-SmartWay,一个端到端的零样本VLN-CE框架,它消除了对全景视图和航点预测器的需求。我们的方法仅使用三张前向RGB-D图像结合自然语言指令,使MLLM能够直接预测动作。为了增强决策鲁棒性,我们引入了一个不确定性感知推理模块,该模块整合了(i) 用于避免局部最优的去歧义模块,以及(ii) 用于全局连贯规划的过去-未来双向推理机制。在模拟环境和真实机器人环境上的实验表明,我们的方法显著降低了每步延迟,同时实现了与基于全景视图的基线方法相当或更优的性能。这些结果证明了Fast-SmartWay在真实世界零样本具身导航中的实用性和有效性。

关键词

引用

@article{arxiv.2511.00933,
  title  = {Fast-SmartWay: Panoramic-Free End-to-End Zero-Shot Vision-and-Language Navigation},
  author = {Xiangyu Shi and Zerui Li and Yanyuan Qiao and Qi Wu},
  journal= {arXiv preprint arXiv:2511.00933},
  year   = {2025}
}