Inter-KD:面向基于 CTC 的自动语音识别的中间知识蒸馏
音频与语音处理
2022-11-29 v1 声音
摘要
近年来,深度学习的进步为端到端语音识别领域带来了显著提升,在简化传统流程的同时产生了有前景的结果。在端到端模型中,基于连接时序分类(CTC)的模型因其非自回归特性而引起了研究兴趣。然而,此类 CTC 模型需要高昂的计算成本才能达到出色性能。为减轻计算负担,我们为 CTC 框架提出一种简单而有效的知识蒸馏(KD)方法,称为 Inter-KD,该方法额外将教师知识迁移至学生网络的中间 CTC 层。基于 LibriSpeech 数据集的实验结果验证,Inter-KD 相较于传统 KD 方法取得了更优表现。在不使用任何语言模型(LM)与数据增强的情况下,Inter-KD 将 test-clean 集上的词错误率(WER)从 8.85% 改善至 6.30%。
引用
@article{arxiv.2211.15075,
title = {Inter-KD: Intermediate Knowledge Distillation for CTC-Based Automatic Speech Recognition},
author = {Ji Won Yoon and Beom Jun Woo and Sunghwan Ahn and Hyeonseung Lee and Nam Soo Kim},
journal= {arXiv preprint arXiv:2211.15075},
year = {2022}
}
备注
Accepted by 2022 SLT Workshop