任务无关的语音表征模型结构化剪枝
音频与语音处理
2025-05-08 v2 计算与语言
声音
摘要
自监督预训练模型如 Wav2vec2、Hubert 和 WavLM 已被证明能显著改善许多语音任务。然而,它们庞大的内存需求和强劲的计算开销阻碍了其工业适用性。结构化剪枝是一种硬件友好的模型压缩技术,但通常会导致更大的精度损失。本文提出一种细粒度注意力头剪枝方法来弥补性能退化。此外,我们还将直通估计器引入 L0 正则化以进一步加速剪枝后的模型。在 SUPERB 基准上的实验表明,我们的模型在多个任务上能达到与稠密模型相当的性能,并平均优于 Wav2vec 2.0 base 模型,且参数减少 72%、推理速度提升 2 倍。
引用
@article{arxiv.2306.01385,
title = {Task-Agnostic Structured Pruning of Speech Representation Models},
author = {Haoyu Wang and Siyuan Wang and Wei-Qiang Zhang and Hongbin Suo and Yulong Wan},
journal= {arXiv preprint arXiv:2306.01385},
year = {2025}
}
备注
Accepted by INTERSPEECH 2023