中文

基于快速注意力的实时语义分割

计算机视觉与模式识别 2020-07-13 v2 多媒体 机器人学

摘要

在基于深度 CNN 的语义分割模型中,高精度依赖于丰富的空间上下文(大感受野)和精细的空间细节(高分辨率),二者均带来高计算成本。本文提出一种新颖架构,同时应对这两大挑战,并在实时条件下对高分辨率图像和视频的语义分割达到最先进性能。所提架构依赖于我们的快速空间注意力,它是对流行自注意力机制的简单而高效的修改,通过改变操作顺序,以极小部分计算成本捕获同样丰富的空间上下文。此外,为高效处理高分辨率输入,我们对网络的中间特征阶段施加额外的空间缩减,得益于使用快速注意力模块融合特征,精度损失极小。我们通过一系列实验验证方法,并表明多个数据集上的结果展现出优于现有实时语义分割方法的性能与速度。在 Cityscapes 上,我们的网络在单块 Titan X GPU 上以 72 FPS 达到 74.4%\% mIoU,以 58 FPS 达到 75.5%\% mIoU,比最先进方法快约 50%\% 且保持相同精度。

关键词

引用

@article{arxiv.2007.03815,
  title  = {Real-time Semantic Segmentation with Fast Attention},
  author = {Ping Hu and Federico Perazzi and Fabian Caba Heilbron and Oliver Wang and Zhe Lin and Kate Saenko and Stan Sclaroff},
  journal= {arXiv preprint arXiv:2007.03815},
  year   = {2020}
}

备注

project page: https://cs-people.bu.edu/pinghu/FANet.html