利用数据统计量进行深度神经网络(DNNs)的权重初始化
机器学习
2018-03-20 v2 机器学习
摘要
深度神经网络(DNNs)几乎构成了计算机视觉、语音处理和文本分析等领域最先进技术的骨干。计算技术的最新进展使得 DNNs 的使用更加实用。尽管 DNN 性能卓越且计算技术不断进步,但可见极少有研究者尝试从零开始训练其模型。DNNs 的训练仍然是一项困难且繁琐的工作。研究者在 DNNs 训练过程中面临的主要挑战是梯度消失/爆炸问题,以及具有多达百万变量的目标函数高度非凸的性质。He 和 Xavier 提出的方法通过提供精细的初始化技术解决了梯度消失问题。这些方法相当有效,并在标准数据集上取得了良好结果,但同样的这些方法在更实际的数据集上表现不佳。我们认为其原因未利用数据统计量来初始化网络权重。优化如此高维的损失函数需要谨慎初始化网络权重。在这项工作中,我们提出一种数据相关的初始化,并针对 He 和 Xavier 等标准初始化技术分析了其性能。我们在一些实际数据集上进行了实验,结果显示我们的算法具有更优的分类精度。
引用
@article{arxiv.1710.10570,
title = {Weight Initialization of Deep Neural Networks(DNNs) using Data Statistics},
author = {Saiprasad Koturwar and Shabbir Merchant},
journal= {arXiv preprint arXiv:1710.10570},
year = {2018}
}
备注
The work is currently under progress