面向可扩展自监督表示的语音质量评估中的蒸馏与剪枝
音频与语音处理
2025-02-11 v1 声音
摘要
本文探讨了蒸馏和剪枝方法以减少基于自监督表示的非侵入式语音质量评估模型的模型大小。我们的实验建立在 XLS-R-SQA 之上,该模型使用 wav2vec 2.0 XLS-R 嵌入。我们在大型的平均意见分数 (MOS) 数据集上重新训练该模型,涵盖超过 10 万个标记化片段。对于蒸馏,使用该模型作为教师模型,生成在无标签退化语音信号上的伪标签,并训练大小不同的学生模型。对于剪枝,我们采用数据驱动策略。尽管数据驱动的剪枝在大型模型规模下表现更好,但针对小型模型规模的蒸馏更有效。蒸馏可以使基线模型与 ground-truth MOS 标签之间的相关性距离教师模型的 XLS-R 基准模型仅缩小一半,而模型大小相对于教师模型缩小了两个数量级。
引用
@article{arxiv.2502.05356,
title = {Distillation and Pruning for Scalable Self-Supervised Representation-Based Speech Quality Assessment},
author = {Benjamin Stahl and Hannes Gamper},
journal= {arXiv preprint arXiv:2502.05356},
year = {2025}
}
备注
Accepted at ICASSP 2025