大规模语音识别中主流端到端模型的比较研究
音频与语音处理
2020-07-31 v2 计算与语言
摘要
近期,自动语音识别领域出现了从混合模型向端到端(E2E)模型过渡的强劲推力。目前有三种有前景的 E2E 方法:循环神经网络转换器(RNN-T)、基于 RNN 注意力的编码器-解码器(AED)以及 Transformer-AED。在本研究中,我们在非流式和流式两种模式下对 RNN-T、RNN-AED 和 Transformer-AED 模型进行了经验性比较。我们使用 6.5 万小时的微软匿名训练数据来训练这些模型。由于 E2E 模型对数据需求更大,因此使用大量训练数据来比较其有效性更为合适。据我们所知,目前尚未进行过此类全面的研究。我们表明,尽管 AED 模型在非流式模式下强于 RNN-T,但如果其编码器能够被适当初始化,RNN-T 在流式模式下极具竞争力。在所有三种 E2E 模型中,Transformer-AED 在流式和非流式模式下均取得了最佳准确率。我们表明,流式 RNN-T 和 Transformer-AED 模型均能获得比高度优化的混合模型更好的准确率。
引用
@article{arxiv.2005.14327,
title = {On the Comparison of Popular End-to-End Models for Large Scale Speech Recognition},
author = {Jinyu Li and Yu Wu and Yashesh Gaur and Chengyi Wang and Rui Zhao and Shujie Liu},
journal= {arXiv preprint arXiv:2005.14327},
year = {2020}
}
备注
Accepted by Interspeech 2020