中文

用于流式RNN Transducer的无HMM编码器预训练

音频与语音处理 2021-06-14 v2 计算与语言 声音

摘要

本工作描述了一种使用逐帧标签的编码器预训练过程,以改进流式循环神经网络转导器(RNN-T)模型的训练。从头训练的流式RNN-T通常比非流式RNN-T表现更差。尽管通常通过以其他准则或逐帧对齐引导预训练RNN-T的组件来解决此问题,但在端到端方式中这种对齐不易获得。本工作中,用于预训练流式RNN-T编码器的逐帧对齐是在不使用基于HMM的系统的情况下生成的。因此构建了一个配备无HMM编码器预训练的全神经网络框架。这是通过将对CTC模型的尖峰扩展至其左/右空白帧实现的,并提出了两种扩展策略。据我们所知,这是首个利用CTC模型模拟基于HMM的逐帧标签进行预训练的工作。在LibriSpeech和MLS英语任务上的实验表明,与随机初始化相比,所提出的预训练过程将WER相对降低5%~11%,并将发射延迟降低60 ms。此外,该方法无需词典,因此对无人工设计词典的新语言友好。

关键词

引用

@article{arxiv.2104.10764,
  title  = {HMM-Free Encoder Pre-Training for Streaming RNN Transducer},
  author = {Lu Huang and Jingyu Sun and Yufeng Tang and Junfeng Hou and Jinkun Chen and Jun Zhang and Zejun Ma},
  journal= {arXiv preprint arXiv:2104.10764},
  year   = {2021}
}

备注

Accepted by Interspeech 2021