中文

保持并行解码:通过从语言模型到端到端语音识别器的有效知识蒸馏

计算与语言 2024-01-23 v1 声音 音频与语音处理

摘要

本研究提出了一种利用中间层从 BERT 教师模型到自动语音识别 (ASR) 模型进行知识蒸馏 (KD) 的新方法。为了蒸馏教师的知识,我们使用了一个从 BERT 的 token 概率中学习的注意力解码器。我们的方法表明,利用中间层和最终层可以将语言模型 (LM) 信息更有效地蒸馏到 ASR 模型中。通过使用中间层作为蒸馏目标,我们可以更有效地将 LM 知识蒸馏到较低的网络层中。使用我们的方法,我们实现了比外部 LM 浅层融合更好的识别准确率,同时能够保持快速的并行解码。在 LibriSpeech 数据集上的实验证明了我们的方法在增强带有连接主义时间分类 (CTC) 的贪婪解码方面的有效性。

关键词

引用

@article{arxiv.2401.11700,
  title  = {Keep Decoding Parallel with Effective Knowledge Distillation from Language Models to End-to-end Speech Recognisers},
  author = {Michael Hentschel and Yuta Nishikawa and Tatsuya Komatsu and Yusuke Fujita},
  journal= {arXiv preprint arXiv:2401.11700},
  year   = {2024}
}

备注

Accepted at ICASSP 2024