中文

DQ-Whisper:面向高效多语言语音识别的联合蒸馏与量化方法

声音 2024-10-01 v2 计算与语言 音频与语音处理

摘要

作为流行的多语言多任务预训练语音模型,Whisper存在多语言诅咒问题。为增强小型Whisper模型的多语言能力,我们提出DQ-Whisper,一种新颖的联合蒸馏与量化框架,用于压缩Whisper以实现高效推理。首先,我们提出一种新颖的动态匹配蒸馏策略。随后,引入量化感知蒸馏框架,将量化与蒸馏相集成。在多个多语言数据集上的实验结果表明,我们所提出的蒸馏方法可在不增加计算成本的情况下有效增强小型Whisper模型的多语言能力。模型尺寸最高缩减5.18倍,且性能下降微小。此外,量化与蒸馏兼容,可带来更高的压缩率。

关键词

引用

@article{arxiv.2305.10788,
  title  = {DQ-Whisper: Joint Distillation and Quantization for Efficient Multilingual Speech Recognition},
  author = {Hang Shao and Bei Liu and Wei Wang and Xun Gong and Yanmin Qian},
  journal= {arXiv preprint arXiv:2305.10788},
  year   = {2024}
}

备注

Accepted by SLT2024