DistilHuBERT:基于隐单元 BERT 分层蒸馏的语音表征学习
计算与语言
2022-04-29 v4 音频与语音处理
摘要
wav2vec 2.0 与隐单元 BERT(HuBERT)等自监督语音表征学习方法利用无标注语音数据进行预训练,并为众多语音处理任务提供良好表征。尽管这些方法取得成功,它们需要大内存与高预训练成本,使学术界研究人员与小型公司难以使用。因此,本文引入 DistilHuBERT,一种新颖的多任务学习框架,直接从 HuBERT 模型蒸馏隐表示。该方法将 HuBERT 规模缩减 75% 且速度提升 73%,同时在十个不同任务中保留大部分性能。此外,DistilHuBERT 所需训练时间与数据极少,为预训练个人与设备上语音 SSL 模型开辟了可能。
引用
@article{arxiv.2110.01900,
title = {DistilHuBERT: Speech Representation Learning by Layer-wise Distillation of Hidden-unit BERT},
author = {Heng-Jui Chang and Shu-wen Yang and Hung-yi Lee},
journal= {arXiv preprint arXiv:2110.01900},
year = {2022}
}
备注
Accepted to ICASSP 2022