基于协同初始化的深度神经网络训练
计算机视觉与模式识别
2020-01-07 v1 机器学习
摘要
研究者已提出多种激活函数。这些激活函数助力深度网络学习非线性行为,并对训练动态与任务性能有显著影响。这些激活函数的性能亦取决于权重参数的初始状态,即不同初始状态导致网络性能差异。本文提出一种基于协同初始化的深度网络训练方法,使用 ReLU 激活函数以提升网络性能。我们的方法在训练网络的最初若干轮中,采用多种激活函数更新所有权重参数集合。这些激活函数协同克服各自在权重参数更新中的缺陷,从而学习到更好的“特征表示”并随后提升网络性能。基于协同初始化的训练还有助于缓解过拟合问题,且在提升性能的同时不增加最终模型的参数量与推理(测试)时间。实验表明,我们的方法优于多种基线,同时在分类与检测等多项任务上表现良好。采用本方法训练的模型在 CIFAR-100 数据集上 Top-1 分类准确率提升:VGG-16 提高 2.8%,ResNet-56 提高 2.1%。
引用
@article{arxiv.2001.01240,
title = {Cooperative Initialization based Deep Neural Network Training},
author = {Pravendra Singh and Munender Varshney and Vinay P. Namboodiri},
journal= {arXiv preprint arXiv:2001.01240},
year = {2020}
}
备注
IEEE Winter Conference on Applications of Computer Vision (WACV), 2020