中文

CCNet:用于语义分割的交叉注意力网络

计算机视觉与模式识别 2020-07-10 v2

摘要

上下文信息在视觉理解问题(如语义分割和目标检测)中至关重要。我们提出了一种交叉网络(CCNet),以非常有效且高效的方式获取全图像上下文信息。具体而言,对于每个像素,一种新颖的交叉注意力模块收集其交叉路径上所有像素的上下文信息。通过进一步的循环操作,每个像素最终可以捕获全图像依赖关系。此外,提出了一种类别一致性损失,以强制交叉注意力模块产生更具判别性的特征。总体而言,CCNet 具有以下优点:1) 对 GPU 内存友好。与非局部块相比,所提出的循环交叉注意力模块所需的 GPU 内存使用量减少 11 倍。2) 高计算效率。循环交叉注意力将 FLOPs 显著减少约非局部块的 85%。3) 最先进的性能。我们在语义分割基准(包括 Cityscapes、ADE20K、人体解析基准 LIP、实例分割基准 COCO、视频分割基准 CamVid)上进行了广泛实验。特别是,我们的 CCNet 在 Cityscapes 测试集、ADE20K 验证集和 LIP 验证集上分别取得了 81.9%、45.76% 和 55.47% 的 mIoU 分数,这些均为新的最先进结果。源代码可在 \url{https://github.com/speedinghzl/CCNet} 获取。

关键词

引用

@article{arxiv.1811.11721,
  title  = {CCNet: Criss-Cross Attention for Semantic Segmentation},
  author = {Zilong Huang and Xinggang Wang and Yunchao Wei and Lichao Huang and Humphrey Shi and Wenyu Liu and Thomas S. Huang},
  journal= {arXiv preprint arXiv:1811.11721},
  year   = {2020}
}

备注

IEEE TPAMI 2020 & ICCV 2019