中文

Open-Nav:使用开源 LLM 探索连续环境中的零样本视觉-语言导航

机器人学 2025-02-12 v2 计算机视觉与模式识别

摘要

视觉-语言导航(VLN)任务要求智能体遵循文本指令在 3D 环境中导航。传统方法使用监督学习方法,严重依赖特定领域的数据集来训练 VLN 模型。最近的方法尝试利用像 GPT-4 这样的闭源大语言模型(LLM)以零样本方式解决 VLN 任务,但在实际应用中面临昂贵的 token 成本和潜在数据泄露的挑战。在本工作中,我们介绍了 Open-Nav,这是一项探索开源 LLM 在连续环境中进行零样本 VLN 的新研究。Open-Nav 采用时空思维链推理方法,将任务分解为指令理解、进度估计和决策制定。它通过细粒度的物体和空间知识增强场景感知,以改善 LLM 在导航中的推理。我们在模拟和真实世界环境中的广泛实验表明,与使用闭源 LLM 相比,Open-Nav 取得了具有竞争力的性能。

关键词

引用

@article{arxiv.2409.18794,
  title  = {Open-Nav: Exploring Zero-Shot Vision-and-Language Navigation in Continuous Environment with Open-Source LLMs},
  author = {Yanyuan Qiao and Wenqi Lyu and Hui Wang and Zixu Wang and Zerui Li and Yuan Zhang and Mingkui Tan and Qi Wu},
  journal= {arXiv preprint arXiv:2409.18794},
  year   = {2025}
}

备注

Accepted by ICRA 2025