探索自监督语音模型用于自动语音识别的有效蒸馏
音频与语音处理
2025-05-08 v3 计算与语言
声音
摘要
近年来,语音处理中的自监督学习(SSL)取得了巨大进展。SSL 模型通常在大量无标注数据上预训练,且偏好较大模型规模以提升建模能力。然而,由于过大模型引入的昂贵计算与内存开销,这可能限制其潜在应用。SSL 模型的小型化已成为具有实际价值的重要研究方向。为此,我们探索了基于 HuBERT 的 SSL 模型用于自动语音识别(ASR)的有效蒸馏。首先,为建立强基线,对不同学生模型结构进行了全面研究。在此基础上,作为对以往工作广泛采用的回归损失的补充,为 HuBERT 引入了判别性损失以增强蒸馏性能,尤其在低资源场景下。此外,我们设计了一种简单有效的算法,将前端输入从波形蒸馏为 Fbank 特征,从而实现 17% 的参数削减与推理速度翻倍,性能退化微小。
引用
@article{arxiv.2210.15631,
title = {Exploring Effective Distillation of Self-Supervised Speech Models for Automatic Speech Recognition},
author = {Yujin Wang and Changli Tang and Ziyang Ma and Zhisheng Zheng and Xie Chen and Wei-Qiang Zhang},
journal= {arXiv preprint arXiv:2210.15631},
year = {2025}
}
备注
Accepted by ASRU 2023