中文

混合剪枝:自监督语音模型的就地压缩用于说话人验证与反欺骗

音频与语音处理 2025-11-11 v2

摘要

尽管大规模自监督学习(SSL)模型如 WavLM 在语音处理中取得了最先进的性能,但其庞大的体积阻碍了在资源受限设备上的部署。虽然结构化剪枝是模型压缩的关键技术,但现有方法通常将其与任务特定的微调分离。这种多阶段方法难以创建针对多样化下游任务的最优架构。在本工作中,我们提出了一种统一的框架,将结构化剪枝融入下游微调过程。我们的框架将这些步骤统一,在单阶段中联合优化任务性能和模型稀疏性。这使模型能够学习针对最终任务的压缩架构,消除了对复杂多阶段流水线以及知识蒸馏的需求。我们的剪枝模型实现了高达 70% 的参数缩减,在大规模数据集上性能损失可忽略不计,在 Vox1-O、-E 和 -H 上分别实现了 0.7%、0.8% 和 1.6% 的等错误率。此外,我们的方法在低资源场景中展示了改进的泛化能力,减少了过拟合,并在 ASVspoof5 上取得了最先进的 3.7% EER。

关键词

引用

@article{arxiv.2508.16232,
  title  = {Hybrid Pruning: In-Situ Compression of Self-Supervised Speech Models for Speaker Verification and Anti-Spoofing},
  author = {Junyi Peng and Lin Zhang and Jiangyu Han and Oldřich Plchot and Johan Rohdin and Themos Stafylakis and Shuai Wang and Jan Černocký},
  journal= {arXiv preprint arXiv:2508.16232},
  year   = {2025}
}