知识蒸馏在多任务语音表征学习中的应用
音频与语音处理
2023-05-22 v2 计算与语言
声音
摘要
诸如 wav2vec 2.0 和 HuBERT 的模型架构已被提出以自监督方式从音频波形中学习语音表征。当它们与关键词 spotting 和说话人验证等下游任务结合时,可提供最先进的性能。然而,这些模型使用大量参数,其最小版本也具有 9500 万参数。这对边缘 AI 设备部署构成挑战。在本文中,我们研究将知识蒸馏应用于语音表征学习(SRL)模型,随后与多个下游语音激活任务联合微调。在我们针对两个此类任务的实验中,与全尺寸模型相比,我们的方法使模型尺寸减小近 75%,而准确率仅下降 0.1%、等错误率仅退化 0.9%。此外,我们表明微调 SRL 模型相比使用冻结的 SRL 模型带来显著的性能提升。
引用
@article{arxiv.2210.16611,
title = {Application of Knowledge Distillation to Multi-task Speech Representation Learning},
author = {Mine Kerpicci and Van Nguyen and Shuhua Zhang and Erik Visser},
journal= {arXiv preprint arXiv:2210.16611},
year = {2023}
}
备注
Speech representation learning, multi-task training, wav2vec, HuBERT, knowledge distillation