中文

结构化剪枝前的微调:面向说话人日志的紧凑且准确的自监督模型

音频与语音处理 2025-06-02 v1

摘要

WavLM 等自监督学习(SSL)模型在构建说话人日志系统时可以被有效利用,但它们通常体积大且速度慢,限制了其在资源受限场景下的使用。先前的研究探索了压缩技术,但通常以高剪枝率下性能下降为代价。在本工作中,我们通过引入知识蒸馏,提出利用结构化剪枝来压缩 SSL 模型。与现有工作不同,我们强调了在剪枝前微调 SSL 模型的重要性。在远场单通道 AMI、AISHELL-4 和 AliMeeting 数据集上的实验表明,我们的方法可以在没有任何性能下降的情况下,移除 WavLM Base+ 和 WavLM Large 中高达 80% 的冗余参数。剪枝后,Base+ 和 Large 模型在单个 GPU 上的推理速度分别提高了 4.0 倍和 2.6 倍。我们的源代码已公开。

关键词

引用

@article{arxiv.2505.24111,
  title  = {Fine-tune Before Structured Pruning: Towards Compact and Accurate Self-Supervised Models for Speaker Diarization},
  author = {Jiangyu Han and Federico Landini and Johan Rohdin and Anna Silnova and Mireia Diez and Jan Cernocky and Lukas Burget},
  journal= {arXiv preprint arXiv:2505.24111},
  year   = {2025}
}

备注

Accepted by INTERSPEECH 2025