GSTO:用于像素标注中多尺度特征学习的门控尺度转移操作
计算机视觉与模式识别
2020-06-30 v2
摘要
现有的基于CNN的像素标注方法严重依赖多尺度特征,以满足语义理解与细节保留的需求。最先进的像素标注神经网络广泛采用常规的尺度转移操作,即上采样和下采样来学习多尺度特征。在本工作中,我们发现这些操作导致尺度混淆特征和次优性能,因为它们是空间不变的,并在无空间选择的情况下直接跨尺度传递所有特征信息。为解决此问题,我们提出门控尺度转移操作(GSTO),以将空间滤波后的特征恰当地转移到另一尺度。具体而言,GSTO可在有或无需额外监督下工作。无监督GSTO从特征本身学习,而有监督的则由监督概率矩阵引导。两种形式的GSTO均为轻量且即插即用,可灵活集成到网络或模块中以学习更好的多尺度特征。特别地,通过将GSTO插入HRNet,我们获得了用于像素标注的更强大骨干网络(即GSTO-HRNet),并在COCO人体姿态估计基准以及包括Cityscapes、LIP和Pascal Context在内的其他语义分割基准上以可忽略的额外计算成本取得了新的SOTA结果。此外,实验结果表明GSTO还能显著提升如PPM和ASPP等多尺度特征聚合模块的性能。代码将发布于https://github.com/VDIGPKU/GSTO。
引用
@article{arxiv.2005.13363,
title = {GSTO: Gated Scale-Transfer Operation for Multi-Scale Feature Learning in Pixel Labeling},
author = {Zhuoying Wang and Yongtao Wang and Zhi Tang and Yangyan Li and Ying Chen and Haibin Ling and Weisi Lin},
journal= {arXiv preprint arXiv:2005.13363},
year = {2020}
}