用于场景分割的双重注意力网络
计算机视觉与模式识别
2019-04-23 v4
摘要
本文中,我们基于自注意力机制捕捉丰富的上下文依赖来解决场景分割任务。与以往通过多尺度特征融合捕捉上下文的工作不同,我们提出双重注意力网络(DANet)以自适应地将局部特征与其全局依赖相整合。具体而言,我们在传统空洞 FCN 之上附加两类注意力模块,分别建模空间与通道维度上的语义相互依赖。位置注意力模块通过所有位置特征的加权和,在每个位置选择性聚合特征。相似特征将彼此关联,无论其距离远近。同时,通道注意力模块通过整合所有通道图间的关联特征,选择性强调相互依赖的通道图。我们将两注意力模块的输出相加以进一步改善特征表示,这有助于更精确的分割结果。我们在三个具挑战性的场景分割数据集,即 Cityscapes、PASCAL Context 与 COCO Stuff 数据集上取得了新的最先进分割性能。特别地,在 Cityscapes 测试集上取得了 81.5% 的平均交并比分数,且未使用粗标注数据。我们将代码与训练模型公开于 https://github.com/junfu1115/DANet
引用
@article{arxiv.1809.02983,
title = {Dual Attention Network for Scene Segmentation},
author = {Jun Fu and Jing Liu and Haijie Tian and Yong Li and Yongjun Bao and Zhiwei Fang and Hanqing Lu},
journal= {arXiv preprint arXiv:1809.02983},
year = {2019}
}
备注
Accepted by CVPR2019