中文

面向远程具身视觉定位的场景直觉智能体

计算机视觉与模式识别 2021-03-25 v1

摘要

人类从生活事件中学习,形成对视觉环境与语言理解的直觉。设想你被一条高层指令“去主卧的浴室并更换左墙上的蓝色毛巾”所指示,你可能会如何执行该任务?直觉上,我们理解指令语义,在脑海中形成浴室所在位置及蓝色毛巾样貌的概览;随后通过持续将脑海中的浴室外观与当前场景匹配来导航至目标位置。本文提出一个模仿此类人类行为的智能体。具体而言,我们关注真实室内环境下的远程具身视觉指代表达任务,称为REVERIE,其中智能体需根据简洁的高层自然语言指令正确定位一个远程目标物体,并提出一个两阶段训练流程。第一阶段,我们用两个跨模态对齐子任务预训练智能体,即场景定位任务与物体定位任务。智能体分别在场景定位任务中学习何处停止、在物体定位任务中学习关注什么。随后,为生成动作序列,我们提出记忆增强的注意力动作解码器,以平滑融合预训练的视觉与语言表示及智能体的过往记忆经验。无需额外技巧,实验结果表明我们的方法显著优于先前最优(state-of-the-art, SOTA),证明了方法的有效性。

关键词

引用

@article{arxiv.2103.12944,
  title  = {Scene-Intuitive Agent for Remote Embodied Visual Grounding},
  author = {Xiangru Lin and Guanbin Li and Yizhou Yu},
  journal= {arXiv preprint arXiv:2103.12944},
  year   = {2021}
}

备注

Accepted by CVPR 2021