中文

基于共享解码器的注意力语音识别中的中间层输出正则化

音频与语音处理 2022-07-12 v1 声音

摘要

通过编码器侧多任务训练实现的中间层输出 (ILO) 正则化已被证明是在广泛端到端 ASR 框架上取得改进结果的有效方法。本文提出一种不同的 ILO 正则化训练新方法。不同于使用带来更多训练开销的传统多任务方法,我们直接将中间层输出作为解码器输入,即我们的解码器不仅接受最终编码器层的输出作为输入,还在训练期间将编码器 ILO 的输出也作为输入。所提方法下,由于编码器与解码器同时被“正则化”,网络得到更充分的训练,相较于基于 ILO 的 CTC 方法以及未采用所提方法的原始基于注意力的建模方法,一致地带来改进结果。

关键词

引用

@article{arxiv.2207.04177,
  title  = {Intermediate-layer output Regularization for Attention-based Speech Recognition with Shared Decoder},
  author = {Jicheng Zhang and Yizhou Peng and Haihua Xu and Yi He and Eng Siong Chng and Hao Huang},
  journal= {arXiv preprint arXiv:2207.04177},
  year   = {2022}
}

备注

5 pages. Submitted to INTERSPEECH 2022