L3MVN:利用大语言模型进行视觉目标导航
机器人学
2023-12-27 v2
摘要
未知环境中的视觉目标导航是机器人学中的关键问题。尽管过去对经典与基于学习的方法已有广泛研究,机器人仍缺乏关于家用物体与布局的常识知识。此前该任务的最优方法依赖于在训练中习得先验,通常需耗费大量昂贵资源与时间进行学习。为此,我们提出一种利用大语言模型(LLM)赋予物体搜索常识的新视觉目标导航框架。具体而言,我们引入两种范式:(i)零样本与(ii)前馈方法,其使用语言从语义图中找出相关边界作为长期目标并高效探索环境。我们的分析展示了使用语言所带来的显著零样本泛化与迁移能力。在 Gibson 与 Habitat-Matterport 3D(HM3D)上的实验表明,所提框架在成功率与泛化性上显著优于现有基于地图的方法。消融分析亦表明,来自语言模型的常识知识带来了更高效的语义探索。最后,我们提供了真实机器人实验以验证框架在真实场景中的适用性。补充视频与代码可通过以下链接访问:https://sites.google.com/view/l3mvn。
引用
@article{arxiv.2304.05501,
title = {L3MVN: Leveraging Large Language Models for Visual Target Navigation},
author = {Bangguo Yu and Hamidreza Kasaei and Ming Cao},
journal= {arXiv preprint arXiv:2304.05501},
year = {2023}
}
备注
7 pages