中文

用于场景解析的自适应上下文网络

计算机视觉与模式识别 2019-11-06 v1

摘要

近期工作试图通过探索不同层次的上下文来提升场景解析性能,并通常训练一个精心设计的卷积网络以在所有像素上同等利用有用上下文。然而,本文发现,每张图像中不同像素或区域对上下文的需求是变化的。基于该观察,我们提出自适应上下文网络(ACNet),通过根据逐像素的不同需求对全局上下文与局部上下文进行竞争性融合,来捕获像素感知的上下文。具体而言,对于给定的像素,其全局上下文需求由全局特征与其局部特征之间的相似性度量,该相似性的反向值可用于度量局部上下文需求。我们分别通过所提出的全局上下文模块与局部上下文模块对这两种需求度量进行建模,以生成自适应上下文特征。此外,我们引入多个此类模块,在网络的不同层次构建若干自适应上下文块,以获得由粗到细的结果。最后,全面的实验评估证明了所提 ACNet 的有效性,并在全部四个公开数据集 Cityscapes、ADE20K、PASCAL Context 和 COCO Stuff 上取得了新的 SOTA 性能。

关键词

引用

@article{arxiv.1911.01664,
  title  = {Adaptive Context Network for Scene Parsing},
  author = {Jun Fu and Jing Liu and Yuhang Wang and Yong Li and Yongjun Bao and Jinhui Tang and Hanqing Lu},
  journal= {arXiv preprint arXiv:1911.01664},
  year   = {2019}
}

备注

Accepted by ICCV 2019