全局二阶池化卷积网络
计算机视觉与模式识别
2018-12-03 v2
摘要
深度卷积网络(ConvNets)除了大规模视觉识别外,还是众多视觉任务的基础。由于卷积网络的主要目标是在高维空间中刻画数千类别的复杂边界,学习高阶表示以增强非线性建模能力至关重要。近年来,置于网络末端的全局二阶池化(GSoP)受到越来越多的关注,在多种视觉任务中取得了比经典一阶网络好得多的性能。然而,如何在前层有效引入高阶表示以提升卷积网络的非线性能力仍是一个开放问题。本文提出一种新颖的网络模型,从低层到高层引入GSoP,以在整个网络中利用整体图像信息。给定由某前序卷积层输出的输入3D张量,我们执行GSoP获得协方差矩阵,经非线性变换后用于沿通道维度进行张量缩放。类似地,我们也可沿空间维度执行GSoP进行张量缩放。以此方式,我们能在整个网络中充分利用整体图像的二阶统计量。所提网络在大规模ImageNet-1K上进行了充分评估,实验表明其在取得最先进结果的同时,显著优于对应网络。
引用
@article{arxiv.1811.12006,
title = {Global Second-order Pooling Convolutional Networks},
author = {Zilin Gao and Jiangtao Xie and Qilong Wang and Peihua Li},
journal= {arXiv preprint arXiv:1811.12006},
year = {2018}
}