中文

声学建模中并行训练算法的实证评估

计算与语言 2018-12-06 v2 机器学习 声音 音频与语音处理

摘要

深度学习模型 (DLM) 是语音识别中的最先进技术。然而,训练好的 DLM 可能非常耗时,尤其是对于生产规模的模型和语料库。尽管已提出多种并行训练算法来提高训练效率,但由于缺乏系统且公平的比较,对于手头任务应选择哪种算法尚无明确指导。本文旨在填补这一空白,在 1000 小时的 LibriSpeech 语料库上,使用前馈深度神经网络 (DNN) 和卷积、长短期记忆、DNN (CLDNN),比较了语音识别中四种流行的并行训练算法,即异步随机梯度下降 (ASGD)、分块模型更新过滤 (BMUF)、批量同步并行 (BSP) 和弹性平均随机梯度下降 (EASGD)。基于我们的实验,我们推荐使用 BMUF 作为训练声学模型的首选,因为它最稳定,能很好地随 GPU 数量扩展,可获得可复现的结果,并且在许多情况下甚至优于单 GPU SGD。在某些情况下,ASGD 可作为替代方案。

关键词

引用

@article{arxiv.1703.05880,
  title  = {Empirical Evaluation of Parallel Training Algorithms on Acoustic Modeling},
  author = {Wenpeng Li and BinBin Zhang and Lei Xie and Dong Yu},
  journal= {arXiv preprint arXiv:1703.05880},
  year   = {2018}
}