知识蒸馏与结构化剪枝在自监督语音模型中的协同效应
音频与语音处理
2025-02-11 v1
摘要
传统上,知识蒸馏(KD)用于模型压缩,常导致性能次优。本文评估了在自监督学习(SSL)范式下,将KD损失与替代性剪枝技术(包括低秩分解(LRF)和l0正则化)结合,对基于Conformer的预训练网络的影响。我们还提出了一种联合剪枝和训练基于RNN-T的语音识别(ASR)模型的策略,证明该方法在先对预训练网络进行剪枝再用于ASR训练方面表现更佳。该方法显著降低了词错误率:l0和KD组合实现了对基线的最佳非流式性能,实现了8.9%的相对词错误率(RWER)改进;而LRF和KD组合在流式ASR中取得最佳结果,RWER提升13.4%。
引用
@article{arxiv.2502.05837,
title = {Synergistic Effects of Knowledge Distillation and Structured Pruning for Self-Supervised Speech Models},
author = {Shiva Kumar C and Jitendra Kumar Dhiman and Nagaraj Adiga and Shatrughan Singh},
journal= {arXiv preprint arXiv:2502.05837},
year = {2025}
}
备注
5 pages, 2 figures, 2025 IEEE International Conference on Acoustics, Speech, and Signal Processing