中文

一种用于自动语音识别的高效分布式深度学习系统

音频与语音处理 2019-07-15 v1 分布式、并行与集群计算 机器学习 声音 机器学习

摘要

现代自动语音识别(ASR)系统依赖分布式深度学习以实现快速训练完成。为实现高效分布式训练,训练算法必须能以较大的小批量规模收敛。本工作中,我们发现异步去中心化并行随机梯度下降(ADPSGD)可使用比常用同步 SGD(SSGD)算法大得多的批量规模。在常用的公开 SWB-300 与 SWB-2000 ASR 数据集上,ADPSGD 能以 SSGD 所用批量规模 3 倍的批量收敛,从而支持更大规模的训练。进一步,我们提出了一种分层-ADPSGD(H-ADPSGD)系统,其中同一计算节点上的学习器通过快速 allreduce 实现构成超级学习器,超级学习器之间采用 ADPSGD 算法。在由 100Gb/s 以太网互联的 64 块 Nvidia V100 GPU 集群上,我们的系统能够在 5.2 小时内将 SWB-2000 训练至在 Hub5-2000 Switchboard(SWB)测试集上 7.6% 的 WER、在 Call-home(CH)测试集上 13.2% 的 WER。据我们所知,这是文献中报道的针对 SWB-2000 任务达到该模型精度级别的最快 ASR 训练系统。

关键词

引用

@article{arxiv.1907.05701,
  title  = {A Highly Efficient Distributed Deep Learning System For Automatic Speech Recognition},
  author = {Wei Zhang and Xiaodong Cui and Ulrich Finkler and George Saon and Abdullah Kayi and Alper Buyuktosunoglu and Brian Kingsbury and David Kung and Michael Picheny},
  journal= {arXiv preprint arXiv:1907.05701},
  year   = {2019}
}