中文

Inter-KD:面向基于 CTC 的自动语音识别的中间知识蒸馏

音频与语音处理 2022-11-29 v1 声音

摘要

近年来,深度学习的进步为端到端语音识别领域带来了显著提升,在简化传统流程的同时产生了有前景的结果。在端到端模型中,基于连接时序分类(CTC)的模型因其非自回归特性而引起了研究兴趣。然而,此类 CTC 模型需要高昂的计算成本才能达到出色性能。为减轻计算负担,我们为 CTC 框架提出一种简单而有效的知识蒸馏(KD)方法,称为 Inter-KD,该方法额外将教师知识迁移至学生网络的中间 CTC 层。基于 LibriSpeech 数据集的实验结果验证,Inter-KD 相较于传统 KD 方法取得了更优表现。在不使用任何语言模型(LM)与数据增强的情况下,Inter-KD 将 test-clean 集上的词错误率(WER)从 8.85% 改善至 6.30%。

关键词

引用

@article{arxiv.2211.15075,
  title  = {Inter-KD: Intermediate Knowledge Distillation for CTC-Based Automatic Speech Recognition},
  author = {Ji Won Yoon and Beom Jun Woo and Sunghwan Ahn and Hyeonseung Lee and Nam Soo Kim},
  journal= {arXiv preprint arXiv:2211.15075},
  year   = {2022}
}

备注

Accepted by 2022 SLT Workshop