级联 CNN-resBiLSTM-CTC:一种用于语音识别的端到端声学模型
音频与语音处理
2018-10-31 v2 计算与语言
声音
摘要
自动语音识别(ASR)任务由端到端深度学习模型解决,其使我们减少原始数据准备并更易实现语言间转换。我们提出一种新颖的端到端深度学习模型架构,即级联 CNN-resBiLSTM-CTC。在该模型中,我们在 BiLSTM 层中加入残差块以共同提取复杂的音素与语义信息,并应用级联结构更加关注挖掘难负样本的信息。通过同时应用简单的快速傅里叶变换(FFT)技术与 n-gram 语言模型(LM)重打分方法,我们在 LibriSpeech test clean 语料上取得了 3.41% 的词错误率(WER)。此外,我们提出一种新的批量变化方法以加速长度可变任务中的训练过程,从而减少了 25% 的训练时间。
引用
@article{arxiv.1810.12001,
title = {Cascaded CNN-resBiLSTM-CTC: An End-to-End Acoustic Model For Speech Recognition},
author = {Xinpei Zhou and Jiwei Li and Xi Zhou},
journal= {arXiv preprint arXiv:1810.12001},
year = {2018}
}
备注
5 pages, 1 figure, 4 tables. Submitted to 2019 ICASSP (International Conference on Acoustics, Speech, and Signal Processing)