量化与剪枝对自监督语音模型在真实下游语音识别任务中性能的影响
音频与语音处理
2023-09-27 v1 声音
摘要
自监督学习的最新进展使语音识别系统仅需其前代所需标注训练数据的一小部分即可达到最先进(SOTA)词错误率(WER)。尽管如此,此类模型在匹配的训练/测试条件下虽取得 SOTA 性能,但在未见条件下测试时性能会大幅下降。为克服该问题,已探索数据增强和/或域偏移训练等策略。然而,现有模型仍过于庞大,难以用于资源受限设备上的边缘语音应用,因此需要模型压缩工具。本文中,我们探究基于压缩自监督语音模型的训练/测试失配条件对语音识别精度的影响。具体而言,我们报告了在含噪声、混响及噪声加混响条件下,基于所谓鲁棒 wav2vec 2.0 模型的参数量化与模型剪枝对语音识别精度的影响。
引用
@article{arxiv.2309.14462,
title = {On the Impact of Quantization and Pruning of Self-Supervised Speech Models for Downstream Speech Recognition Tasks "In-the-Wild''},
author = {Arthur Pimentel and Heitor Guimarães and Anderson R. Avila and Mehdi Rezagholizadeh and Tiago H. Falk},
journal= {arXiv preprint arXiv:2309.14462},
year = {2023}
}