端到端注意力语音识别模型的改进训练
计算与语言
2019-08-06 v1 机器学习
机器学习
摘要
基于子词单元的自回归序列到序列注意力模型可实现简单的开放词表端到端语音识别。本工作中,我们展示此类模型在 Switchboard 300h 与 LibriSpeech 1000h 任务上能取得有竞争力的结果。特别地,我们报告了 LibriSpeech 的 dev-clean 与 test-clean 评测子集上 3.54% 与 3.82% 的当前最优词错误率(WER)。我们引入了一种新的预训练方案:以高时间缩减因子开始并在训练中逐步降低,这对收敛与最终性能都至关重要。部分实验中,我们还使用了辅助 CTC 损失函数以帮助收敛。此外,我们在子词单元上训练长短期记忆(LSTM)语言模型。通过浅融合,我们报告了相较无语言模型的注意力基线在 WER 上最高 27% 的相对提升。
引用
@article{arxiv.1805.03294,
title = {Improved training of end-to-end attention models for speech recognition},
author = {Albert Zeyer and Kazuki Irie and Ralf Schlüter and Hermann Ney},
journal= {arXiv preprint arXiv:1805.03294},
year = {2019}
}
备注
submitted to Interspeech 2018