用于混合语音识别的基于 Transformer 的声学建模
计算与语言
2020-05-01 v2 音频与语音处理
摘要
我们提出并评估了用于混合语音识别的基于 Transformer 的声学模型(AM)。本工作讨论了若干建模选择,包括各种位置嵌入方法以及用于训练深层 Transformer 的迭代损失。我们还初步研究了在 Transformer 模型中使用有限右上下文,以使流式应用成为可能。我们证明,在广泛使用的 Librispeech 基准上,当使用标准 n-gram 语言模型(LM)时,我们的基于 Transformer 的 AM 相对最优已发表混合结果取得了 19% 至 26% 的相对提升。结合用于重打分(rescoring)的神经网络 LM,我们提出的方法在 Librispeech 上取得了最先进(state-of-the-art)结果。我们的发现也在大得多的内部数据集上得到验证。
引用
@article{arxiv.1910.09799,
title = {Transformer-based Acoustic Modeling for Hybrid Speech Recognition},
author = {Yongqiang Wang and Abdelrahman Mohamed and Duc Le and Chunxi Liu and Alex Xiao and Jay Mahadeokar and Hongzhao Huang and Andros Tjandra and Xiaohui Zhang and Frank Zhang and Christian Fuegen and Geoffrey Zweig and Michael L. Seltzer},
journal= {arXiv preprint arXiv:1910.09799},
year = {2020}
}
备注
to appear in ICASSP 2020