中文

利用语义地图监督学习导航视觉表征

计算机视觉与模式识别 2023-07-25 v1 机器人学

摘要

能够感知环境的语义与空间结构对家用机器人的视觉导航至关重要。然而,大多数现有工作仅采用基于独立图像分类预训练的视觉骨干,或采用自监督学习方法以适应室内导航领域,忽视了对于导航学习至关重要的空间关系。受人类在导航时于大脑中自然构建语义与空间有意义的认知地图的行为启发,本文提出一种新颖的导航专用视觉表征学习方法,通过对比智能体的第一人称视角与语义地图(Ego2^2-Map)。我们应用视觉Transformer作为骨干编码器,并利用从大规模Habitat-Matterport3D环境中收集的数据训练模型。Ego2^2-Map学习将地图中紧凑而丰富的信息(如物体、结构与转移关系)迁移至智能体的第一人称表征以用于导航。实验表明,在物体目标导航中使用我们所学表征的智能体优于近期视觉预训练方法。此外,我们的表征显著提升了连续环境中视觉-语言导航在高层与低层动作空间上的表现,在测试服务器上取得了47% SR与41% SPL的新的SOTA结果。

关键词

引用

@article{arxiv.2307.12335,
  title  = {Learning Navigational Visual Representations with Semantic Map Supervision},
  author = {Yicong Hong and Yang Zhou and Ruiyi Zhang and Franck Dernoncourt and Trung Bui and Stephen Gould and Hao Tan},
  journal= {arXiv preprint arXiv:2307.12335},
  year   = {2023}
}