DQ-Whisper:面向高效多语言语音识别的联合蒸馏与量化方法
声音
2024-10-01 v2 计算与语言
音频与语音处理
摘要
作为流行的多语言多任务预训练语音模型,Whisper存在多语言诅咒问题。为增强小型Whisper模型的多语言能力,我们提出DQ-Whisper,一种新颖的联合蒸馏与量化框架,用于压缩Whisper以实现高效推理。首先,我们提出一种新颖的动态匹配蒸馏策略。随后,引入量化感知蒸馏框架,将量化与蒸馏相集成。在多个多语言数据集上的实验结果表明,我们所提出的蒸馏方法可在不增加计算成本的情况下有效增强小型Whisper模型的多语言能力。模型尺寸最高缩减5.18倍,且性能下降微小。此外,量化与蒸馏兼容,可带来更高的压缩率。
引用
@article{arxiv.2305.10788,
title = {DQ-Whisper: Joint Distillation and Quantization for Efficient Multilingual Speech Recognition},
author = {Hang Shao and Bei Liu and Wei Wang and Xun Gong and Yanmin Qian},
journal= {arXiv preprint arXiv:2305.10788},
year = {2024}
}
备注
Accepted by SLT2024