中文

深度神经网络的自适应归一化风险规避训练

机器学习 2016-06-10 v3 神经与进化计算 机器学习

摘要

本文提出一组新的误差准则与学习方法——自适应归一化风险规避训练(Adaptive Normalized Risk-Averting Training, ANRAT),以应对深度神经网络(DNNs)训练中的非凸优化问题。理论上,我们证明了其在由标准 LpL_p-范数误差下界限定的全局与局部凸性上的有效性。通过分析凸性指数 λ\lambda 上的梯度,我们解释了为何使用梯度下降自适应学习 λ\lambda 可行。在实践中,我们展示了该方法如何改进深度神经网络的训练,以在 MNIST 和 CIFAR-10 数据集上解决视觉识别任务。在不使用预训练或其他技巧的情况下,我们取得了与近期文献中采用标准卷积网络(ConvNets)+ MSE/交叉熵在相同任务上报告的结果相当或更优的性能。我们还探索了其在深层/浅层多层感知机与去噪自编码器上的表现。ANRAT 可与其他拟牛顿训练方法、创新网络变体、正则化技术以及 DNNs 中的其他特定技巧结合。除无监督预训练外,它为解决 DNNs 中的非凸优化问题提供了新视角。

关键词

引用

@article{arxiv.1506.02690,
  title  = {Adaptive Normalized Risk-Averting Training For Deep Neural Networks},
  author = {Zhiguang Wang and Tim Oates and James Lo},
  journal= {arXiv preprint arXiv:1506.02690},
  year   = {2016}
}

备注

AAAI 2016, 0.39%~0.4% ER on MNIST with single 32-32-256-10 ConvNets, code available at https://github.com/cauchyturing/ANRAE