面向基于CTC的ASR的BERT知识蒸馏
计算与语言
2022-09-07 v1 声音
音频与语音处理
摘要
基于连接时序分类(CTC)的模型因其在自动语音识别(ASR)中的快速推理而颇具吸引力。浅融合和重打分等语言模型(LM)集成方法可利用文本语料库中的知识提高基于CTC的ASR的识别准确率。然而,它们显著降低了CTC的推理速度。在本研究中,我们提出蒸馏BERT的知识用于基于CTC的ASR,扩展了我们先前针对基于注意力ASR的研究。基于CTC的ASR在训练期间学习BERT的知识,且在测试时不使用BERT,从而保持了CTC的快速推理。与基于注意力的模型不同,基于CTC的模型进行帧级预测,因此需要与BERT的令牌级预测对齐以进行蒸馏。我们提出通过计算最可能的CTC路径来获得对齐。在日语自发语音语料库(CSJ)和TED-LIUM2上的实验评估表明,我们的方法在不牺牲推理速度的前提下提升了基于CTC的ASR的性能。
引用
@article{arxiv.2209.02030,
title = {Distilling the Knowledge of BERT for CTC-based ASR},
author = {Hayato Futami and Hirofumi Inaguma and Masato Mimura and Shinsuke Sakai and Tatsuya Kawahara},
journal= {arXiv preprint arXiv:2209.02030},
year = {2022}
}