中文

探索 Transformer 在大规模语音识别中的应用

音频与语音处理 2020-08-13 v2 计算与语言 声音

摘要

尽管循环神经网络在很大程度上仍定义着最先进的语音识别系统,但 Transformer 网络已被证明是一种有竞争力的替代方案,尤其在离线条件下。大多数关于 Transformer 的研究受限于相对较小的规模设置,并且通常会采用某些形式的数据增强方法来应对数据稀疏问题。在本文中,我们旨在理解 Transformer 在大规模语音识别设置下的行为,其中我们使用了约 65,000 小时的训练数据。我们研究了扩展 Transformer 的各个方面,包括模型初始化、预热训练以及不同的层归一化策略。在流式条件下,我们将广泛使用的基于注意力掩码的未来上下文前瞻方法与 Transformer-XL 网络进行了比较。从我们的实验来看,我们表明 Transformer 在离线方式下相比 BLSTM 基线可实现约 6% 的相对词错误率(WER)降低,而在流式方式下,Transformer-XL 在 800 毫秒延迟约束下与 LC-BLSTM 相当。

关键词

引用

@article{arxiv.2005.09684,
  title  = {Exploring Transformers for Large-Scale Speech Recognition},
  author = {Liang Lu and Changliang Liu and Jinyu Li and Yifan Gong},
  journal= {arXiv preprint arXiv:2005.09684},
  year   = {2020}
}

备注

5 pages, 1 figure, Interspeech 2020 Camera Ready