中文

将自然梯度与无 Hessian 方法结合用于序列训练

机器学习 2018-10-05 v1 机器学习

摘要

本文提出一种新的优化方法,以判别性序列准则训练深度神经网络(DNNs)。在每次迭代中,该方法将来自自然梯度(NG)方向的信息与误差曲面的局部曲率信息相结合,从而在参数流形上遍历更优路径。该方法借助泰勒定理的另一种推导得出,使用了来自信息几何视角的流形、切向量与方向导数概念。该方法的有效性在一个无 Hessian(HF)风格的优化框架中得到展示,用于序列训练标准全连接 DNN 和时延神经网络作为语音识别声学模型。结果表明,在相同的更新次数下,所提方法比 NG 和 HF 均取得更大的词错误率(WER)下降,并且也比标准随机梯度下降导致更低的 WER。本文还探讨了主要因 ReLU-DNN 模型序列训练期间训练准则与词错误率(WER)不匹配而引起的过拟合问题。

关键词

引用

@article{arxiv.1810.01873,
  title  = {Combining Natural Gradient with Hessian Free Methods for Sequence Training},
  author = {Adnan Haider and P. C. Woodland},
  journal= {arXiv preprint arXiv:1810.01873},
  year   = {2018}
}

备注

in Proc. INTERSPEECH 2018, September 2-6, 2018, Hyderabad, India