中文

AttaNet:用于快速且精确场景解析的注意力增强网络

计算机视觉与模式识别 2021-03-11 v1

摘要

有两个因素被证明对语义分割模型的性能非常重要:全局上下文与多级语义。然而,生成同时捕捉这两个因素的特徵总是导致高计算复杂度,这在实时场景中是有问题的。本文中,我们提出一种称为注意力增强网络(AttaNet)的新模型,以在保持高效率的同时捕捉全局上下文与多级语义。AttaNet由两个主要模块组成:条带注意力模块(SAM)与注意力融合模块(AFM)。鉴于在分割精度低的困难图像中,垂直条带区域的数量显著多于水平条带区域,与非局部方法相比,SAM利用条带化操作大幅降低垂直方向编码全局上下文的复杂度,同时保留大部分上下文信息。此外,AFM遵循跨层级聚合策略以限制计算量,并采用注意力策略在融合时对每个像素不同层级特征的重要性进行加权,从而获得高效的多级表示。我们在两个语义分割基准上进行了广泛实验,我们的网络在Cityscapes上实现了不同水平的速/精度权衡,例如71 FPS/79.9% mIoU、130 FPS/78.5% mIoU和180 FPS/70.1% mIoU,并在ADE20K上也取得了领先性能。

关键词

引用

@article{arxiv.2103.05930,
  title  = {AttaNet: Attention-Augmented Network for Fast and Accurate Scene Parsing},
  author = {Qi Song and Kangfu Mei and Rui Huang},
  journal= {arXiv preprint arXiv:2103.05930},
  year   = {2021}
}

备注

AAAI 2021