利用稀疏感知自夹紧门对语音基础模型进行高效单次压缩
声音
2025-05-29 v1 人工智能
音频与语音处理
摘要
本文提出了一种新颖的语音基础模型压缩方法,该方法将模型剪枝和参数更新紧密集成到单一阶段中。仅包含单个可学习阈值的紧凑型层级绑定自夹紧门与未压缩模型联合训练,并用于细粒度神经元级剪枝。在 LibriSpeech-100hr 语料库上进行的实验表明,我们的方法分别将 wav2vec2.0-base 和 HuBERT-large 模型的参数量减少了 65% 和 60%,同时在 test-clean 数据集上未引起具有统计学显著性的词错误率(WER)增加。与针对同一任务已发表的方法相比,我们的方法不仅在 4.26 倍的相当模型压缩率下,在 test-clean 数据集上实现了 7.05% 的最低 WER,而且模型压缩时间至少减少了 25%。
引用
@article{arxiv.2505.22608,
title = {Effective and Efficient One-pass Compression of Speech Foundation Models Using Sparsity-aware Self-pinching Gates},
author = {Haoning Xu and Zhaoqing Li and Youjun Chen and Huimeng Wang and Guinan Li and Mengzhe Geng and Chengxi Deng and Xunying Liu},
journal= {arXiv preprint arXiv:2505.22608},
year = {2025}
}
备注
Submitted to Interspeech 2025