给定多层支撑时 CNN 的全局最优性
机器学习
2017-12-15 v2 计算机视觉与模式识别
神经与进化计算
摘要
随机梯度下降(SGD)是训练现代 CNN 的核心主力方法。尽管具有令人印象深刻的经验性能,其收敛可能较慢。在本文中,我们探索了一种使用交替策略训练 CNN 的新颖策略,该策略在训练期间提供了显著的加速。我们作出以下贡献:(i)将 CNN 中的 ReLU 非线性替换为正硬阈值化;(ii)将此非线性重新解释为二值状态向量,使得在已知多层支撑时整个 CNN 是线性的;(iii)证明在某些条件下可通过局部下降找到 CNN 的全局最优解。我们随后采用一种新颖的交替策略(在权重与支撑之间)用于 CNN 训练,其带来显著更快的收敛速率、良好的理论性质,并在大规模数据集(如 ImageNet)以及其他标准基准上取得最先进结果。
引用
@article{arxiv.1712.02501,
title = {CNNs are Globally Optimal Given Multi-Layer Support},
author = {Chen Huang and Chen Kong and Simon Lucey},
journal= {arXiv preprint arXiv:1712.02501},
year = {2017}
}