深度CNN从全局协方差池化中获益何在:一个优化视角
计算机视觉与模式识别
2020-03-26 v1
摘要
近期工作表明,全局协方差池化(GCP)能够提升深度卷积神经网络(CNNs)在视觉分类任务上的性能。尽管取得了可观进展,GCP 对深度 CNNs 生效的原因尚未被充分研究。本文中,我们尝试从优化视角理解深度 CNNs 从 GCP 中获益何在。具体而言,我们从优化损失的 Lipschitz 性质和梯度的可预测性两方面探究 GCP 对深度 CNNs 的影响,并表明 GCP 能使优化景观更平滑、梯度更具可预测性。此外,我们讨论了 GCP 与深度 CNNs 二阶优化的联系。更重要的是,上述发现可解释协方差池化用于训练深度 CNNs 的若干先前未被认识或充分发掘的优势,包括显著加速网络收敛(即使用 GCP 训练的网络可支持学习率快速衰减,在显著减少训练周期数的同时取得良好性能)、对图像损坏和扰动生成的失真样本更强的鲁棒性,以及对不同视觉任务(如目标检测和实例分割)良好的泛化能力。我们使用多种深度 CNN 模型在不同任务上进行了大量实验,结果有力支持了我们的发现。
引用
@article{arxiv.2003.11241,
title = {What Deep CNNs Benefit from Global Covariance Pooling: An Optimization Perspective},
author = {Qilong Wang and Li Zhang and Banggu Wu and Dongwei Ren and Peihua Li and Wangmeng Zuo and Qinghua Hu},
journal= {arXiv preprint arXiv:2003.11241},
year = {2020}
}
备注
Accepted to CVPR 2020; Project Page: https://github.com/ZhangLi-CS/GCP_Optimization