探索用于端到端语音识别的神经转录器
计算与语言
2017-07-25 v1 神经与进化计算
摘要
在这项工作中,我们对用于端到端语音识别的 CTC、RNN-Transducer 和基于注意力的 Seq2Seq 模型进行了实证比较。我们表明,在没有任何语言模型的情况下,Seq2Seq 和 RNN-Transducer 模型在流行的 Hub5'00 基准测试上均优于已报道的最佳带语言模型的 CTC 模型。在我们的内部多样化数据集上,这些趋势得以延续——经过束搜索后使用语言模型重新评分的 RNN-Transducer 模型优于我们最佳的 CTC 模型。这些结果简化了语音识别流程,使得解码现在可以纯粹表示为神经网络操作。我们还研究了编码器架构的选择如何影响这三种模型的性能——当所有编码器层仅为前向时,以及当编码器对输入表示进行大幅下采样时。
引用
@article{arxiv.1707.07413,
title = {Exploring Neural Transducers for End-to-End Speech Recognition},
author = {Eric Battenberg and Jitong Chen and Rewon Child and Adam Coates and Yashesh Gaur and Yi Li and Hairong Liu and Sanjeev Satheesh and David Seetapun and Anuroop Sriram and Zhenyao Zhu},
journal= {arXiv preprint arXiv:1707.07413},
year = {2017}
}