中文

多尺度注意力 U-Net (MsAUNet):一种用于场景分割的改进 U-Net 架构

计算机视觉与模式识别 2020-09-16 v1 机器学习

摘要

尽管卷积神经网络(CNN)近年来在场景分割任务中取得了日益增长的成功,标准模型仍缺乏一些可能导致次优分割输出的重要特性。广泛使用的编码器-解码器架构在不同步骤和不同尺度上提取并使用了若干冗余和低级特征。此外,这些网络未能映射局部特征的长程依赖,导致在所得分割图像中对应每个语义类的判别性特征图。本文中,我们利用图像丰富的上下文信息,提出了一种用于场景分割的新型多尺度注意力网络。不同于原始 UNet 架构,我们使用了注意力门,其以编码器的特征和金字塔池化的输出作为输入,产生的输出进一步与上一层金字塔池化层的上采样输出拼接并映射到下一后续层。该网络能以更高精度映射局部特征与其全局对应特征,并通过仅关注相关局部特征来强调判别性图像区域。我们还通过优化 IoU 损失并将 Dice 损失与加权交叉熵损失与之融合,提出了一种复合损失函数,以更快收敛速率获得最优解。我们在 PascalVOC2012 和 ADE20k 两个标准数据集上评估了模型,分别在两个数据集上取得了 79.88% 和 44.88% 的平均 IoU,并与广泛已知的模型比较以证明我们的模型相对于它们的优越性。

关键词

引用

@article{arxiv.2009.06911,
  title  = {Multi-scale Attention U-Net (MsAUNet): A Modified U-Net Architecture for Scene Segmentation},
  author = {Soham Chattopadhyay and Hritam Basak},
  journal= {arXiv preprint arXiv:2009.06911},
  year   = {2020}
}

备注

12 Pages, 7 figures