缩小Bigfoot:缩减wav2vec 2.0的占用空间
计算与语言
2021-04-02 v2
摘要
Wav2vec 2.0是一种最先进的语音识别模型,可将语音音频波形映射为潜在表示。Wav2vec 2.0的最大版本包含3.17亿参数。因此,wav2vec 2.0的推理延迟将成为生产中的瓶颈,导致高成本与显著的环境足迹。为提升wav2vec在生产环境中的适用性,我们探索了从大语言模型领域借鉴的多种模型压缩方法。利用教师-学生方法,我们将原始wav2vec 2.0模型的知识蒸馏到一个学生模型中,该学生模型比原始模型快2倍、小4.8倍。这一性能提升仅伴随词错误率(WER)7%的下降。我们的量化模型比原始模型小3.6倍,WER仅下降0.1%。据我们所知,这是首个压缩wav2vec 2.0的工作。
引用
@article{arxiv.2103.15760,
title = {Shrinking Bigfoot: Reducing wav2vec 2.0 footprint},
author = {Zilun Peng and Akshay Budhkar and Ilana Tuil and Jason Levy and Parinaz Sobhani and Raphael Cohen and Jumana Nassour},
journal= {arXiv preprint arXiv:2103.15760},
year = {2021}
}
备注
Submitted to INTERSPEECH 2021