中文

基于3D空间关系注意力机制改进目标驱动的视觉导航

计算机视觉与模式识别 2020-05-06 v1 机器学习 机器学习

摘要

具身智能(AI)任务正从聚焦于互联网图像的任务转向涉及在3D环境中感知与行动的具身智能体的主动场景。本文研究在3D室内场景中使用深度强化学习(DRL)进行目标驱动的视觉导航,其导航任务旨在训练一个智能体,使其仅基于自我中心视角就能智能地做出一系列决策,从任意可能的起始位置到达预先指定的目标位置。然而,目前大多数导航方法仍难以应对数据效率、自动避障和泛化等几个具有挑战性的问题。泛化问题意味着智能体不具备将以往经验中学到的导航技能迁移到未见目标和场景的能力。为解决这些问题,我们在经典DRL框架中引入了两个设计:3D知识图谱(KG)注意力机制和目标技能扩展(TSE)模块。一方面,我们提出的方法结合视觉特征和3D空间表示来学习导航策略。另一方面,TSE模块用于生成子目标,使智能体能够从失败中学习。具体而言,我们的3D空间关系通过近期流行的图卷积网络(GCN)进行编码。考虑到真实世界场景,我们的工作还考虑了开放动作,并在常规导航情境中加入了可操作目标。这些更困难的设置被用于测试DRL智能体是否真正理解其任务、导航环境并能够进行推理。我们在AI2-THOR中进行的实验表明,我们的模型在SR和SPL指标上均优于基线方法,并提升了跨目标和场景的泛化能力。

关键词

引用

@article{arxiv.2005.02153,
  title  = {Improving Target-driven Visual Navigation with Attention on 3D Spatial Relationships},
  author = {Yunlian Lv and Ning Xie and Yimin Shi and Zijiao Wang and Heng Tao Shen},
  journal= {arXiv preprint arXiv:2005.02153},
  year   = {2020}
}

备注

12 pages, 9 figures