具有多分支架构的深度神经网络非凸性更弱
机器学习
2018-08-26 v2 机器学习
摘要
近年来提出的若干神经网络架构,如 ResNeXt、Inception、Xception、SqueezeNet 和 Wide ResNet,均基于多分支的设计思路,并在许多应用中展现出更优的性能。我们表明,此类成功的一个原因在于多分支架构在对偶间隙意义上非凸性更弱。对偶间隙衡量了一个优化问题的内在非凸程度:相对值越小意味着内在非凸程度越低。面临的挑战是对深度神经网络等高度非凸问题定量度量其对偶间隙。本文中,我们针对两类网络架构给出了该量的强保证。对于具有任意激活函数、多分支架构以及一种 hinge 损失变体的神经网络,我们证明随着分支数增加,总体风险与经验风险的对偶间隙均收缩至零。该结果有助于更好地理解过参数化的作用,即增加网络宽度往往使损失曲面非凸性降低。对于具有线性激活函数和 损失的神经网络,我们证明经验风险的对偶间隙为零。我们的两个结果适用于任意深度和对抗数据,而相关分析技术本身对更广泛的非凸优化亦具独立意义。在合成与真实世界数据集上的实验验证了我们的结果。
引用
@article{arxiv.1806.01845,
title = {Deep Neural Networks with Multi-Branch Architectures Are Less Non-Convex},
author = {Hongyang Zhang and Junru Shao and Ruslan Salakhutdinov},
journal= {arXiv preprint arXiv:1806.01845},
year = {2018}
}
备注
26 pages, 6 figures, 3 tables; v2 fixes some typos. arXiv admin note: text overlap with arXiv:1712.08559 by other authors