中文

一种有效的深度卷积神经网络训练方法

机器学习 2017-10-18 v5 人工智能 机器学习

摘要

在本文中,我们提出了非线性生成方法来加速和稳定深度卷积神经网络的训练。所提出的方法将一族激活函数修改为非线性生成器(NGs)。NGs 使激活函数对其输入呈线性对称以降低模型容量,并在训练过程中自动引入非线性以增强模型容量。所提出的方法可被视为一种不寻常的正则化形式:模型参数通过训练一个相对低容量、在开始时相对容易优化的模型获得,仅需少量迭代,这些参数随后被重用于初始化一个更高容量的模型。我们推导了权重变化方差的上界和下界,并表明 NGs 的初始对称结构有助于稳定训练。我们在两个目标识别基准任务(CIFAR-10 和 CIFAR-100)上,在不同的卷积神经网络框架下评估了所提出的方法。实验结果表明,所提出的方法使我们能够:(1)加速训练收敛,(2)允许不那么仔细的权重初始化,(3)以可忽略的额外计算成本提高或至少维持模型性能,以及(4)轻松训练非常深的模型。

关键词

引用

@article{arxiv.1708.01666,
  title  = {An Effective Training Method For Deep Convolutional Neural Network},
  author = {Yang Jiang and Zeyang Dou and Qun Hao and Jie Cao and Kun Gao and Xi Chen},
  journal= {arXiv preprint arXiv:1708.01666},
  year   = {2017}
}