中文

去噪自编码器中基于梯度的预训练的收敛性

机器学习 2015-02-13 v1 计算机视觉与模式识别 最优化与控制

摘要

深度架构的成功至少部分归因于逐层无监督预训练对网络进行初始化。各类论文已报道了聚焦于良好预训练过程设计与实现的广泛实证分析。然而,关于参数估计的一致性、学习过程的收敛性以及样本量估计的理解在文献中仍然缺失。本工作中,我们针对经典和分布式去噪自编码器中的预训练展开研究,以这些目标为出发点。我们表明梯度以1N\frac{1}{\sqrt{N}}的速率收敛,并且对自编码器网络规模具有亚线性依赖。在将整个网络的不相交部分同步预训练的分布式设定中,我们表明收敛性至少改善τ3/4\tau^{3/4},其中τ\tau对应于各部分的大小。我们提供了一组广泛的实验来实证评估所建议的行为。

关键词

引用

@article{arxiv.1502.03537,
  title  = {Convergence of gradient based pre-training in Denoising autoencoders},
  author = {Vamsi K Ithapu and Sathya Ravi and Vikas Singh},
  journal= {arXiv preprint arXiv:1502.03537},
  year   = {2015}
}

备注

20 pages