中文

SepPrune:高效深度语音分离的结构化剪枝

声音 2025-05-20 v1 人工智能 音频与语音处理

摘要

尽管深度学习在近年来大幅提升了语音分离性能,但现有大多数研究仍侧重分离质量,忽视了计算效率——这在低延迟实时语音处理中是关键因素。本文提出 SepPrune,首个专为压缩深度语音分离模型、降低计算成本而设计的结构化剪枝框架。SepPrune 通过分析给定模型的计算结构,识别出计算负担最重的层;引入可微掩码策略,实现梯度驱动的通道选择;据此剪枝冗余通道并微调剩余参数以恢复性能。大量实验表明,这一可学习的剪枝范式在语音分离模型的通道剪枝中显著优于现有方法。值得注意的是,使用 SepPrune 剪枝后的模型仅需一轮微调即可恢复预训练模型(数百轮训练)的 85% 性能,且收敛速度比从头训练快 36 倍。代码已公开于 https://github.com/itsnotacie/SepPrune。

关键词

引用

@article{arxiv.2505.12079,
  title  = {SepPrune: Structured Pruning for Efficient Deep Speech Separation},
  author = {Yuqi Li and Kai Li and Xin Yin and Zhifei Yang and Junhao Dong and Zeyu Dong and Chuanguang Yang and Yingli Tian and Yao Lu},
  journal= {arXiv preprint arXiv:2505.12079},
  year   = {2025}
}