中文

VLN-Game:面向零样本语义导航的视觉-语言均衡搜索

机器人学 2024-11-19 v1

摘要

遵循人类指令在陌生环境中探索并搜索特定目标,是移动服务机器人的一项关键技能。以往关于目标物体导航的大多数工作通常集中于单一输入模态作为目标,这可能导致对包含详细属性和空间关系的语言描述考虑不足。为解决这一局限性,我们提出了 VLN-Game,一种用于视觉目标导航的新型零样本框架,能够有效处理物体名称和描述性语言目标。具体而言,我们的方法通过将预训练的视觉-语言特征与物理环境的 3D 重建相融合,构建了一个以物体为中心的 3D 空间地图。随后,该框架识别出最有希望的区域,以探索并寻找潜在的目标候选。我们采用了一个基于博弈论的视觉语言模型来确定哪个目标最匹配给定的语言描述。在 Habitat-Matterport 3D (HM3D) 数据集上进行的实验表明,所提出的框架在目标物体导航和基于语言的导航任务中均达到了 SOTA 性能。此外,我们展示了 VLN-Game 可以轻松部署在真实世界的机器人上。VLN-Game 的成功突显了将博弈论方法与紧凑的视觉-语言模型相结合以提升机器人系统决策能力的广阔前景。补充视频与代码可通过以下链接获取:https://sites.google.com/view/vln-game。

关键词

引用

@article{arxiv.2411.11609,
  title  = {VLN-Game: Vision-Language Equilibrium Search for Zero-Shot Semantic Navigation},
  author = {Bangguo Yu and Yuzhen Liu and Lei Han and Hamidreza Kasaei and Tingguang Li and Ming Cao},
  journal= {arXiv preprint arXiv:2411.11609},
  year   = {2024}
}

备注

15 pages, 9 figures