CL-CoTNav:面向零样本目标导航的视觉语言模型闭环层次链律
机器人学
2025-04-15 v1
摘要
视觉目标导航 (ObjectNav) 需要机器人在未见环境中利用自我观察定位目标对象。然而,决策策略常在转移到未见环境和新目标对象时难以有效应用,这是核心的泛化问题。传统的端到端学习方法加剧了这一问题,因为它们依赖记忆空间模式而非采用结构化推理,限制了有效泛化的能力。在本文中,我们引入闭环层次链律导航 (CL-CoTNav),一种由视觉语言模型 (VLM) 驱动的 ObjectNav 框架,将结构化推理和闭环反馈集成到导航决策中。为增强泛化能力,我们使用源自人类演示轨迹的多轮问答数据对 VLM 进行微调。该结构化数据集启用了层次链律 (H-CoT) 提示,系统性地提取组成知识以细化感知和决策,灵感来自人类通过迭代推理步骤定位目标对象的认知过程。此外,我们提出闭环 H-CoT 机制,将检测和推理置信度得分纳入训练。这种自适应加权策略引导模型优先处理高置信度的数据对,减轻噪声输入的影响,增强对幻觉或不正确推理的鲁棒性。在 AI Habitat 环境中进行的广泛实验表明,CL-CoTNav 在未见场景和新目标类别上表现出优异的泛化能力。我们的方法在导航成功率 (SR) 和按路径长度加权的成功率 (SPL) 上 consistently 超过最新方法 22.4%。我们在项目页面上发布了数据集、模型及补充视频。
引用
@article{arxiv.2504.09000,
title = {CL-CoTNav: Closed-Loop Hierarchical Chain-of-Thought for Zero-Shot Object-Goal Navigation with Vision-Language Models},
author = {Yuxin Cai and Xiangkun He and Maonan Wang and Hongliang Guo and Wei-Yun Yau and Chen Lv},
journal= {arXiv preprint arXiv:2504.09000},
year = {2025}
}