FitHuBERT:面向语音自监督学习知识蒸馏的更窄更深设计
音频与语音处理
2022-07-04 v1 计算与语言
机器学习
摘要
大规模语音自监督学习(SSL)已成为语音处理的主要领域,然而其庞大模型规模带来的计算成本问题给学术界设置了较高的入门门槛。此外,现有的语音SSL模型蒸馏技术通过减少层数来压缩模型,这导致音素识别(PR)等语言模式识别任务上的性能下降。本文提出FitHuBERT,与先前的语音SSL蒸馏工作相比,它在几乎所有模型组件上维度更窄、层数更深。此外,我们采用时间缩减层以加速推理时间,并提出一种基于提示(hint)的蒸馏方法以减少性能下降。与HuBERT相比,我们的方法将模型大小减少至23.8%、推理时间减少至35.9%。同时,我们在SUPERB基准上取得了12.1%的词错误率和13.3%的音素错误率,优于先前工作。
引用
@article{arxiv.2207.00555,
title = {FitHuBERT: Going Thinner and Deeper for Knowledge Distillation of Speech Self-Supervised Learning},
author = {Yeonghyeon Lee and Kangwook Jang and Jahyun Goo and Youngmoon Jung and Hoirin Kim},
journal= {arXiv preprint arXiv:2207.00555},
year = {2022}
}
备注
Accepted to Interspeech 2022