探索利用对齐信息预训练基于 RNN Transducer 的端到端语音识别
计算与语言
2020-05-05 v1 音频与语音处理
摘要
近年来,循环神经网络转导器(RNN-T)架构因具备在线流式语音识别能力而成为端到端自动语音识别研究中的新兴趋势。然而,RNN-T 训练因巨大的内存需求和复杂的神经结构而困难重重。缓解 RNN-T 训练的一种常见方案是采用连接时序分类(CTC)模型与 RNN 语言模型(RNNLM)来初始化 RNN-T 参数。在本工作中,我们反过来利用外部对齐信息来播种 RNN-T 模型。探索了两种不同的预训练方案,分别称为编码器预训练和全网络预训练。在微软 65,000 小时已去除个人可识别信息的匿名生产数据上评估,我们提出的方法取得了显著改进。特别地,与随机初始化和广泛使用的 CTC+RNNLM 初始化策略相比,编码器预训练方案分别实现了 10% 和 8% 的相对词错误率降低。我们的方案还显著降低了 RNN-T 模型相对于基线的延迟。
引用
@article{arxiv.2005.00572,
title = {Exploring Pre-training with Alignments for RNN Transducer based End-to-End Speech Recognition},
author = {Hu Hu and Rui Zhao and Jinyu Li and Liang Lu and Yifan Gong},
journal= {arXiv preprint arXiv:2005.00572},
year = {2020}
}
备注
Accepted by ICASSP 2020