从声学模型集成中蒸馏知识用于联合CTC-注意力端到端语音识别
机器学习
2021-07-06 v3 声音
音频与语音处理
机器学习
摘要
知识蒸馏已广泛用于压缩现有深度学习模型,同时在广泛应用上保持性能。在自动语音识别(ASR)这一具体背景下,从声学模型集成中蒸馏近来在提升识别性能方面展现出有前景的结果。本文中,我们提出将多教师蒸馏方法扩展至联合CTC-注意力端到端ASR系统。我们还引入了三种新颖的蒸馏策略。其核心直觉是将错误率度量整合进教师选择,而非仅关注观测损失。以此方式,我们直接蒸馏并优化学生朝向语音识别的相关度量。我们在不同数据集(TIMIT、Librispeech、Common Voice)与多种语言(英语、法语、意大利语)下的一组训练流程中评估这些策略。特别地,在Common Voice法语、意大利语及TIMIT数据集上报告了最先进的错误率。
引用
@article{arxiv.2005.09310,
title = {Distilling Knowledge from Ensembles of Acoustic Models for Joint CTC-Attention End-to-End Speech Recognition},
author = {Yan Gao and Titouan Parcollet and Nicholas Lane},
journal= {arXiv preprint arXiv:2005.09310},
year = {2021}
}