中文

用于语音识别的神经转导器高效训练

计算与语言 2023-10-20 v4 声音 音频与语音处理

摘要

作为最流行的语音识别序列到序列建模范式之一,RNN-Transducer 随着规模越来越大、训练轮数不断增加的日益复杂的神经网络模型取得了演进的性能。虽然强大的计算资源似乎是训练优越模型的先决条件,我们试图通过精心设计的更高效训练流程来克服这一点。本工作中,我们提出一种高效的 3 阶段渐进式训练流程,以在非常有限的计算资源和合理短时间内从零构建高性能神经转导器模型。每一阶段的有效性在 Librispeech 和 Switchboard 语料库上经实验验证。所提流程能够在仅 2-3 周内用单块 GPU 训练出接近最先进性能的转导器模型。我们最佳的 conformer 转导器在 Librispeech test-other 上仅训练 35 轮即取得 4.1% 的 WER。

关键词

引用

@article{arxiv.2204.10586,
  title  = {Efficient Training of Neural Transducer for Speech Recognition},
  author = {Wei Zhou and Wilfried Michel and Ralf Schlüter and Hermann Ney},
  journal= {arXiv preprint arXiv:2204.10586},
  year   = {2023}
}

备注

accepted at Interspeech 2022