用于场景解析的先全局聚合后局部分布
计算机视觉与模式识别
2021-09-01 v1
摘要
对长程上下文关系建模对于语义分割等逐像素预测任务至关重要。然而,卷积神经网络(CNN)由于其构建模块(如局部卷积核)中的朴素结构,本质上难以建模此类依赖关系。尽管近期的全局聚合方法有利于长程结构信息建模,但它们会过度平滑并向包含精细细节(如边界和小物体)的区域引入噪声,而这些区域正是语义分割任务所非常关注的。为缓解该问题,我们提出探索局部上下文,使聚合的长程关系能在局部区域中更精确地分布。特别地,我们设计了一种新颖的局部分布模块,为每个像素自适应地建模全局与局部关系之间的亲和力图。结合现有全局聚合模块,我们的方法可模块化为端到端可训练块,并轻松插入现有语义分割网络,由此产生GALD网络。尽管简单且通用,我们的方法使我们在包括Cityscapes、ADE20K、Pascal Context、Camvid和COCO-stuff在内的主要语义分割基准上建立了新的最优结果。代码与训练模型发布于\url{https://github.com/lxtGH/GALD-DGCNet}以促进进一步研究。
引用
@article{arxiv.2107.13154,
title = {Global Aggregation then Local Distribution for Scene Parsing},
author = {Xiangtai Li and Li Zhang and Guangliang Cheng and Kuiyuan Yang and Yunhai Tong and Xiatian Zhu and Tao Xiang},
journal= {arXiv preprint arXiv:2107.13154},
year = {2021}
}
备注
Accepted by IEEE-TIP-2021. arXiv admin note: text overlap with arXiv:1909.07229