在训练数据有限的领域中改进基于LSTM-CTC的ASR性能
计算与语言
2018-05-24 v2
摘要
本文探讨了基于长短期记忆(LSTM)神经网络并使用连接时序分类(CTC)损失函数训练的自动语音识别(ASR)系统,与基于混合深度神经网络(DNN)并使用交叉熵(CE)损失函数在有限数据领域上训练的系统之间观察到的性能差距。我们逐步进行了一系列实验,展示了在基于EESEN工具包、在Librispeech 100hr (train-clean-100)语料上训练的LSTM-CTC ASR基线系统上的渐进改进。我们的结果表明,通过数据增强和正则化的有效结合,基于LSTM-CTC的系统可以超过在相同数据上训练的强Kaldi基线的性能。
引用
@article{arxiv.1707.00722,
title = {Improving LSTM-CTC based ASR performance in domains with limited training data},
author = {Jayadev Billa},
journal= {arXiv preprint arXiv:1707.00722},
year = {2018}
}
备注
13 pages Revised Figure 4