通过隐式预条件和采样加速深度神经网络的 Hessian-free 优化
机器学习
2013-12-11 v3 计算与语言
神经与进化计算
最优化与控制
机器学习
摘要
Hessian-free 训练已成为深度神经网络训练中一种流行的并行二阶优化技术。本研究旨在通过减少训练数据量以及减少用于 Hessian 隐式估计的 Krylov 子空间求解器迭代次数,来加速 Hessian-free 训练。在本文中,我们开发了一种基于 L-BFGS 的预条件方案,避免了显式访问 Hessian 矩阵的需求。由于 L-BFGS 不能被视为定点迭代,我们进一步提出采用灵活的 Krylov 子空间求解器,以保留其传统对应方法所需的理论收敛保证。其次,我们提出了一种新的采样算法,该算法几何级数地增加了用于梯度和 Krylov 子空间迭代计算的数据量。在一个 50 小时的英语广播新闻任务上,我们发现这些方法提供了约 1.5 倍的加速;而在一个 300 小时的 Switchboard 任务上,这些技术提供了超过 2.3 倍的加速,且未造成词错误率 (WER) 的损失。这些结果表明,随着问题规模扩大和复杂度增加,预计将获得进一步的加速。
引用
@article{arxiv.1309.1508,
title = {Accelerating Hessian-free optimization for deep neural networks by implicit preconditioning and sampling},
author = {Tara N. Sainath and Lior Horesh and Brian Kingsbury and Aleksandr Y. Aravkin and Bhuvana Ramabhadran},
journal= {arXiv preprint arXiv:1309.1508},
year = {2013}
}
备注
this paper is not supposed to be posted publically before the conference in December due to company policy. another co-author was not informed of this and posted without the permission of the first author. pls remove