中文

语音基础模型的有效且高效混合精度量化

声音 2025-01-14 v2 人工智能 音频与语音处理

摘要

本文提出了一种 novel 的混合精度量化方法,用于语音基础模型,该方法将混合精度学习与量化模型参数估计紧密集成到单一的模型压缩阶段。在LibriSpeech数据集上对fine-tuned的wav2vec2.0-base和HuBERT-large模型进行实验,表明所得的混合精度量化模型相对于各自均匀精度和两阶段混合精度量化基线(后者在独立且互不相干的阶段中分别进行精度学习和模型参数量化),在无损压缩比上提高了最高可达1.7倍和1.9倍,而且未对32位全精度模型造成统计意义上的词错误率(WER)增加。wav2vec2.0-base和HuBERT-large模型的系统压缩时间分别相对于两阶段混合精度基线缩短了最高可达1.9和1.5倍,虽然两种方法都产生了更低的WER。表现最佳的3.5位混合精度量化HuBERT-large模型相对于32位全精度系统实现了8.6倍的无损压缩比。

关键词

引用

@article{arxiv.2501.03643,
  title  = {Effective and Efficient Mixed Precision Quantization of Speech Foundation Models},
  author = {Haoning Xu and Zhaoqing Li and Zengrui Jin and Huimeng Wang and Youjun Chen and Guinan Li and Mengzhe Geng and Shujie Hu and Jiajun Deng and Xunying Liu},
  journal= {arXiv preprint arXiv:2501.03643},
  year   = {2025}
}

备注

To appear at IEEE ICASSP 2025