中文

大词汇量端到端语音识别系统的端到端训练

音频与语音处理 2019-12-25 v1 机器学习 声音 信号处理 机器学习

摘要

本文中,我们提出一种用于构建最先进端到端语音识别系统的端到端训练框架。我们的训练系统利用中央处理器(CPU)与图形处理器(GPU)集群。全部数据读取、大规模数据增强、神经网络参数更新均“即时”完成。我们使用声道长度扰动 [1] 与声学模拟器 [2] 进行数据增强。处理后的特征与标签被送至 GPU 集群。采用 Horovod allreduce 方法训练神经网络参数。我们在标准 Librispeech 语料库 [3] 与 10,000 小时匿名 Bixby 英语数据集上评估了系统的有效性。使用此训练基础设施构建的端到端语音识别系统,在结合 Transformer 语言模型(LM)进行浅融合后,于 LibriSpeech 测试集的 test-clean 上取得 2.44% 的词错率(WER)。对于专有的 Bixby 英语开放域测试集,我们使用双向全注意力(BFA)端到端模型并结合 RNN-LM 浅融合取得 7.92% 的 WER。当采用基于单调分块注意力(MoCha)的方法进行流式语音识别时,我们在同一 Bixby 开放域测试集上取得 9.95% 的 WER。

关键词

引用

@article{arxiv.1912.11040,
  title  = {end-to-end training of a large vocabulary end-to-end speech recognition system},
  author = {Chanwoo Kim and Sungsoo Kim and Kwangyoun Kim and Mehul Kumar and Jiyeon Kim and Kyungmin Lee and Changwoo Han and Abhinav Garg and Eunhyang Kim and Minkyoo Shin and Shatrughan Singh and Larry Heck and Dhananjaya Gowda},
  journal= {arXiv preprint arXiv:1912.11040},
  year   = {2019}
}

备注

Accepted and presented at the ASRU 2019 conference