基于感知能力导向的连续视觉语言导航规划
机器人学
2024-08-21 v2 计算与语言
摘要
基于大语言模型(LLM)的智能体在视觉语言导航(VLN)任务中展现出惊人的零样性能,但现有方法往往仅关注通过选择预定义导航图中的节点来解决高层任务规划,忽略了导航场景中的低层控制。为弥合这一差距,我们提出了一种新的感知能力导向规划器(AO-Planner),用于连续VLN任务。我们的AO-Planner集成了多种基础模型,实现感知能力导向的低层运动规划和高层决策,两者均在零样设置下完成。具体而言,我们采用视觉感知引导法(VAP),通过SAM对可见地面进行分割以提供导航感知能力,基于此LLM选择潜在的候选路径点并规划至所选路径点的低层路径。我们进一步提出了高层PathAgent,其将规划路径标注在图像输入中,并通过理解环境信息推理出最可能的路径。最后,我们利用相机内参和深度信息将选定路径转换为3D坐标,避免了对LLM进行复杂3D预测。在具有挑战性的R2R-CE和RxR-CE数据集上实验表明,AO-Planner实现了零样态态的最佳性能(SPL提升8.8%)。我们的方法还可作为数据标注器获取伪标签,将其路径点预测能力蒸馏到基于学习的预测器中。该预测器无需来自模拟器的任何路径点数据,即可达到47%的成功率,与受监督方法相当。我们在LLM与3D世界之间建立了有效的连接,为在低层运动控制中应用基础模型提供了新的前景。
引用
@article{arxiv.2407.05890,
title = {Affordances-Oriented Planning using Foundation Models for Continuous Vision-Language Navigation},
author = {Jiaqi Chen and Bingqian Lin and Xinmin Liu and Lin Ma and Xiaodan Liang and Kwan-Yee K. Wong},
journal= {arXiv preprint arXiv:2407.05890},
year = {2024}
}