中文

用于 RGB-D 目标检测的跨模态注意力上下文学习

计算机视觉与模式识别 2018-12-26 v1

摘要

从同时感知的光度(RGB)和深度通道中识别物体是许多机器视觉应用(如机器人抓取和自动驾驶)中一个基础且实际的问题。在本文中,我们通过开发跨模态注意力上下文(CMAC)学习框架来解决此问题,该框架能够充分利用来自 RGB 和深度数据的上下文信息。与现有的 RGB-D 目标检测框架相比,我们的方法具有若干吸引人的特性。首先,它由一个基于注意力的全局上下文模型组成,用于挖掘自适应上下文信息,并将该信息融入基于区域的 CNN(例如 Fast RCNN)框架中,以实现改进的目标检测性能。其次,我们的 CMAC 框架进一步包含一个细粒度物体部件注意力模块,以利用每个可能物体区域内部多个有判别力的物体部件,从而获得更优的局部特征表示。在大幅提升 RGB-D 目标检测精度的同时,我们所提模型中有效的跨模态信息融合以及注意力上下文建模提供了一种可解释的视觉化方案。实验结果表明,所提方法在所有公开基准上显著优于当前最优(SOTA)方法。

关键词

引用

@article{arxiv.1810.12829,
  title  = {Cross-Modal Attentional Context Learning for RGB-D Object Detection},
  author = {Guanbin Li and Yukang Gan and Hejun Wu and Nong Xiao and Liang Lin},
  journal= {arXiv preprint arXiv:1810.12829},
  year   = {2018}
}

备注

Accept as a regular paper to IEEE Transactions on Image Processing