基于高秩 LSTM-CTC 模型的端到端语音识别
计算与语言
2019-03-14 v1
摘要
基于长短期记忆连接时序分类(LSTM-CTC)的端到端模型因其训练简单和解码高效而广泛应用于语音识别。在传统的基于 LSTM-CTC 的模型中,瓶颈投影矩阵将 LSTM 获得的隐藏特征向量映射到 softmax 输出层。本文中,我们提出使用高秩投影层来替代投影矩阵。高秩投影层的输出是通过不同投影矩阵和非线性激活函数从隐藏特征向量投影而来的向量的加权组合。高秩投影层能够提升 LSTM-CTC 模型的表现力。实验结果表明,在 Wall Street Journal (WSJ) 语料库和 LibriSpeech 数据集上,所提方法相较基线 CTC 系统实现了 4%–6% 的相对词错误率(WER)降低。在不使用外部数据或数据增强的条件下,它们优于其他已发表的基于 CTC 的端到端(E2E)模型。代码已发布于 https://github.com/mobvoi/lstm_ctc。
引用
@article{arxiv.1903.05261,
title = {End-To-End Speech Recognition Using A High Rank LSTM-CTC Based Model},
author = {Yangyang Shi and Mei-Yuh Hwang and Xin Lei},
journal= {arXiv preprint arXiv:1903.05261},
year = {2019}
}
备注
ICASSP 2019