中文

HCNet:用于语义分割的分层上下文网络

计算机视觉与模式识别 2020-10-21 v2

摘要

全局上下文信息在视觉理解问题中至关重要,尤其在像素级语义分割中。主流方法采用自注意力机制来建模全局上下文信息。然而,属于不同类别的像素通常具有较弱的特征相关性。在自注意力机制中不加区分地建模全局像素级相关性矩阵极为冗余。为解决上述问题,我们提出一种分层上下文网络,以差异化地建模具有强相关性的同类像素与具有弱相关性的异类像素。具体而言,我们首先提出多尺度引导预分割模块,将整个特征图划分为不同的基于类别的同类区域。在每个同类区域内,我们设计像素上下文模块以捕获像素级相关性。随后,不同于仍以密集像素级方式建模弱异类相关性的自注意力机制,我们提出区域上下文模块,利用每个区域的统一表示来建模稀疏的区域级依赖关系。通过聚合细粒度像素上下文特征与粗粒度区域上下文特征,我们所提出的网络不仅能够分层建模全局上下文信息,还能获取多粒度表示,从而更鲁棒地识别多尺度目标。我们在 Cityscapes 与 ISPRS Vaihingen 数据集上评估了我们的方法。无需额外技巧,我们的方法在 Cityscapes 与 ISPRS Vaihingen 测试集上分别实现了 82.8% 的平均交并比(mean IoU)与 91.4% 的总体精度,取得了最先进(state-of-the-art)的结果。

关键词

引用

@article{arxiv.2010.04962,
  title  = {HCNet: Hierarchical Context Network for Semantic Segmentation},
  author = {Yanwen Chong and Congchong Nie and Yulong Tao and Xiaoshu Chen and Shaoming Pan},
  journal= {arXiv preprint arXiv:2010.04962},
  year   = {2020}
}