中文

CoDERT:通过协同学习蒸馏编码器表征用于基于转导器的语音识别

计算与语言 2021-06-16 v1 机器学习 音频与语音处理

摘要

我们提出了一种简单而有效的方法来通过众所周知的知识蒸馏范式压缩 RNN-Transducer(RNN-T)。我们表明,转导器的编码器输出天然具有高熵,并包含关于声学相似词片混淆的丰富信息。当与较低熵的解码器输出结合以产生联合网络 logits 时,这一丰富信息被抑制。因此,我们引入了一个辅助损失,从教师转导器的编码器中蒸馏编码器 logits,并探索了该编码器蒸馏有效工作的训练策略。我们发现,教师与学生编码器通过原位编码器蒸馏进行串联训练优于使用预训练且静态的教师转导器。我们还报告了一个有趣的现象,我们称之为隐式蒸馏,它发生在教师和学生编码器共享同一解码器时。我们的实验显示,在内部测试集上相对词错误率降低(WERR)为 5.37-8.4%,在 LibriSpeech 测试集上相对 WERR 为 5.05-6.18%。

关键词

引用

@article{arxiv.2106.07734,
  title  = {CoDERT: Distilling Encoder Representations with Co-learning for Transducer-based Speech Recognition},
  author = {Rupak Vignesh Swaminathan and Brian King and Grant P. Strimel and Jasha Droppo and Athanasios Mouchtaris},
  journal= {arXiv preprint arXiv:2106.07734},
  year   = {2021}
}

备注

Accepted at InterSpeech 2021