CLIP-Nav:利用 CLIP 进行零样本视觉与语言导航
计算机视觉与模式识别
2022-12-01 v1 人工智能
计算与语言
机器人学
摘要
家庭环境在视觉上是多样的。在自然环境中执行视觉与语言导航(VLN)的具身智能体必须能够处理这种多样性,同时遵循任意的语言指令。最近,像 CLIP 这样的视觉-语言模型在零样本物体识别任务上展现出了优异的性能。在这项工作中,我们探讨这些模型是否也具备零样本语言定位的能力。具体而言,我们利用 CLIP 来解决零样本 VLN 这一新问题,使用描述目标物体的自然语言指代表达,这与过去使用描述物体类别的简单语言模板的工作形成对比。我们检验了 CLIP 在没有任何数据集特定微调的情况下做出序列导航决策的能力,并研究了它如何影响智能体行走的路径。我们在粗粒度指令跟随任务 REVERIE 上的结果证明了 CLIP 的导航能力,在成功率(SR)和路径长度加权成功率(SPL)方面均超越了有监督的基线。更重要的是,我们定量地表明,当通过成功率相对变化(RCS)进行评估时,与 SOTA 完全有监督学习方法相比,我们基于 CLIP 的零样本方法具有更好的泛化能力,在各环境中表现出一致的性能。
引用
@article{arxiv.2211.16649,
title = {CLIP-Nav: Using CLIP for Zero-Shot Vision-and-Language Navigation},
author = {Vishnu Sashank Dorbala and Gunnar Sigurdsson and Robinson Piramuthu and Jesse Thomason and Gaurav S. Sukhatme},
journal= {arXiv preprint arXiv:2211.16649},
year = {2022}
}
备注
8 pages, Accepted at LangRob Workshop at Conference on Robot Learning (CoRL), 2022