DistillW2V2:一种基于 Wav2vec 2.0 的小型流式 ASR 模型
音频与语音处理
2023-03-17 v1 声音
摘要
Wav2vec 2.0(W2V2)在自动语音识别(ASR)中展现出了令人印象深刻的性能。然而,其庞大的模型规模与非流式架构使其难以在低资源或流式场景下使用。在本工作中,我们提出一种两阶段知识蒸馏方法来解决这两个问题:第一步使大型非流式教师模型变小,第二步使其变为流式。具体而言,我们采用 MSE 损失对隐藏层进行蒸馏,并采用改进的 LF-MMI 损失对预测层进行蒸馏。实验在 Gigaspeech、Librispeech 以及一个内部数据集上进行。结果表明,我们最终得到的学生蒸馏模型(DistillW2V2)比原始教师模型快 8 倍、小 12 倍。在 480ms 延迟设置下,DistillW2V2 的相对词错误率(WER)退化在测试集上介于 9% 到 23.4% 之间,这揭示了一条拓展 W2V2 应用范围的 promising 途径。
引用
@article{arxiv.2303.09278,
title = {DistillW2V2: A Small and Streaming Wav2vec 2.0 Based ASR Model},
author = {Yanzhe Fu and Yueteng Kang and Songjun Cao and Long Ma},
journal= {arXiv preprint arXiv:2303.09278},
year = {2023}
}