基于在线注意力的编码器-解码器模型的改进多阶段训练
音频与语音处理
2020-01-01 v1 机器学习
声音
信号处理
机器学习
摘要
在本文中,我们提出一种精炼的多阶段多任务训练策略,以提升在线基于注意力的编码器-解码器(AED)模型的性能。提出了基于三种架构粒度(即字符编码器、基于字节对编码(BPE)的编码器和注意力解码器)的三阶段训练。同时,使用了基于两级语言粒度(即字符与 BPE)的多任务学习。我们探索了编码器的不同预训练策略,包括从双向编码器进行迁移学习。我们的带在线注意力的编码器-解码器模型相对于较小和较大模型的基线分别取得了35%和10%的相对提升。在与基于长短期记忆(LSTM)的外部语言模型(LM)融合后,我们的模型在 Librispeech test-clean 数据上,较小和较大模型分别取得了 5.04% 和 4.48% 的词错误率(WER)。
引用
@article{arxiv.1912.12384,
title = {Improved Multi-Stage Training of Online Attention-based Encoder-Decoder Models},
author = {Abhinav Garg and Dhananjaya Gowda and Ankur Kumar and Kwangyoun Kim and Mehul Kumar and Chanwoo Kim},
journal= {arXiv preprint arXiv:1912.12384},
year = {2020}
}
备注
Accepted and presented at the ASRU 2019 conference