VLN-Zero:面向机器人导航零样本迁移的快速探索与缓存增强神经符号视觉语言规划
机器人学
2025-09-24 v1 人工智能
计算机视觉与模式识别
机器学习
系统与控制
系统与控制
摘要
在未见环境中的快速适应是实现可扩展现实世界自主性的关键,然而现有方法依赖于穷举式探索或僵硬的导航策略,无法有效泛化。我们提出 VLN-Zero,一个两阶段视觉语言导航框架,利用视觉语言模型高效构建符号化场景图并实现零样本神经符号导航。在探索阶段,结构化提示引导基于 VLM 的搜索趋向信息丰富且多样的轨迹,生成紧凑的场景图表示。在部署阶段,神经符号规划器对场景图和环境观测进行推理以生成可执行计划,同时缓存增强的执行模块通过复用先前计算的任务-位置轨迹加速适应过程。通过结合快速探索、符号推理与缓存增强执行,所提框架克服了先前视觉语言导航方法的计算低效与泛化性差的问题,在未见环境中实现了稳健且可扩展的决策。与 SOTA 零样本模型相比,VLN-Zero 的成功率提高 2 倍,优于大多数微调基线,并且在多样化环境中到达目标位置的时间减半,平均 VLM 调用次数减少 55%。VLN-Zero 的代码库、数据集和视频可在 https://vln-zero.github.io/ 获取。
引用
@article{arxiv.2509.18592,
title = {VLN-Zero: Rapid Exploration and Cache-Enabled Neurosymbolic Vision-Language Planning for Zero-Shot Transfer in Robot Navigation},
author = {Neel P. Bhatt and Yunhao Yang and Rohan Siva and Pranay Samineni and Daniel Milan and Zhangyang Wang and Ufuk Topcu},
journal= {arXiv preprint arXiv:2509.18592},
year = {2025}
}
备注
Codebase, datasets, and videos for VLN-Zero are available at: https://vln-zero.github.io/