中文

基于图的全局推理网络

计算机视觉与模式识别 2018-12-03 v1

摘要

在图像和视频的许多计算机视觉任务中,对区域间关系进行全局建模与推理是有益的。卷积神经网络 (CNNs) 擅长通过卷积操作建模局部关系,但通常难以高效捕捉远距离区域间的全局关系,且需要堆叠多个卷积层。在本工作中,我们提出一种新的全局推理方法,其中一组特征在坐标空间上被全局聚合,然后投影到交互空间,在该空间中可高效计算关系推理。推理后,感知关系的特征被分布回原始坐标空间以用于下游任务。我们进一步给出了所提方法的一个高效实例,并引入全局推理单元 (GloRe unit),其通过加权全局池化和加权广播实现坐标-交互空间映射,并通过交互空间中小图上的图卷积实现关系推理。所提 GloRe 单元轻量、端到端可训练,并可轻松插入现有 CNN 以用于广泛任务。大量实验表明,我们的 GloRe 单元能持续提升最先进骨干架构(包括 ResNet、ResNeXt、SE-Net 和 DPN)在 2D 和 3D CNN 上的性能,涉及图像分类、语义分割和视频动作识别任务。

关键词

引用

@article{arxiv.1811.12814,
  title  = {Graph-Based Global Reasoning Networks},
  author = {Yunpeng Chen and Marcus Rohrbach and Zhicheng Yan and Shuicheng Yan and Jiashi Feng and Yannis Kalantidis},
  journal= {arXiv preprint arXiv:1811.12814},
  year   = {2018}
}