中文

结合自然梯度与无 Hessian 的分布式优化框架用于判别序列训练

机器学习 2021-03-16 v1 计算与语言 声音 音频与语音处理

摘要

本文提出一种新颖的自然梯度与无 Hessian(NGHF)优化框架,用于神经网络训练,该框架可高效地以分布式方式运行。它依赖线性共轭梯度(CG)算法将自然梯度(NG)方法与来自无 Hessian(HF)或其他二阶方法的局部曲率信息相结合。对 CG 中一个数值问题的求解使得仅需远少于通常所需的 CG 迭代次数(例如 5-8 次而非 200 次)即可生成有效的参数更新。本工作还提出了一种新颖的预条件方法,以改善具有共享参数的模型在单个 CG 迭代中的进展。尽管可应用于其他训练损失和模型结构,本文中 NGHF 针对基于栅格的判别序列训练进行了研究,该训练使用标准循环神经网络、长短期记忆(LSTM)以及时间延迟神经网络模型进行输出概率计算,用于混合隐马尔可夫模型声学模型。我们在多类型广播(multi-genre broadcast)数据集上针对一系列不同声学模型类型报告了自动语音识别实验。这些实验表明,与标准随机梯度下降或 Adam 相比,NGHF 实现了更大的词错误率降低,同时所需的参数更新次数少几个数量级。

关键词

引用

@article{arxiv.2103.07554,
  title  = {A Distributed Optimisation Framework Combining Natural Gradient with Hessian-Free for Discriminative Sequence Training},
  author = {Adnan Haider and Chao Zhang and Florian L. Kreyssig and Philip C. Woodland},
  journal= {arXiv preprint arXiv:2103.07554},
  year   = {2021}
}