中文

面向零样本实例导航的优先语义学习

计算机视觉与模式识别 2024-07-18 v2

摘要

我们研究零样本实例导航,即智能体在不使用目标物体标注进行训练的情况下导航到特定物体。以往的物体导航方法采用图像目标导航(ImageNav)任务(前往某张图像所在位置)进行预训练,并利用视觉-语言模型迁移智能体以实现物体目标。然而,这些方法导致语义忽视问题,即模型未能学习到有意义的语义对齐。本文提出一种优先语义学习(PSL)方法,以提升导航智能体的语义理解能力。具体而言,我们提出一个语义增强的PSL智能体,并引入一种优先语义训练策略,用于选择具有清晰语义监督的目标图像,并将奖励函数从严格的精确视角匹配中放宽。在推理阶段,设计了一种语义扩展推理方案,以保持与训练阶段相同粒度的目标语义。此外,针对流行的HM3D环境,我们提出了实例导航(InstanceNav)任务,该任务要求前往具有详细描述的特定物体实例,而非目标仅由物体类别定义的传统物体导航(ObjectNav)任务。我们的PSL智能体在零样本ObjectNav上的成功率比先前最优方法高出66%,在新的InstanceNav任务上也表现更优。代码将发布于https://github.com/XinyuSun/PSL-InstanceNav。

关键词

引用

@article{arxiv.2403.11650,
  title  = {Prioritized Semantic Learning for Zero-shot Instance Navigation},
  author = {Xinyu Sun and Lizhao Liu and Hongyan Zhi and Ronghe Qiu and Junwei Liang},
  journal= {arXiv preprint arXiv:2403.11650},
  year   = {2024}
}

备注

Accepted by ECCV 2024