中文

DistilHuBERT:基于隐单元 BERT 分层蒸馏的语音表征学习

计算与语言 2022-04-29 v4 音频与语音处理

摘要

wav2vec 2.0 与隐单元 BERT(HuBERT)等自监督语音表征学习方法利用无标注语音数据进行预训练,并为众多语音处理任务提供良好表征。尽管这些方法取得成功,它们需要大内存与高预训练成本,使学术界研究人员与小型公司难以使用。因此,本文引入 DistilHuBERT,一种新颖的多任务学习框架,直接从 HuBERT 模型蒸馏隐表示。该方法将 HuBERT 规模缩减 75% 且速度提升 73%,同时在十个不同任务中保留大部分性能。此外,DistilHuBERT 所需训练时间与数据极少,为预训练个人与设备上语音 SSL 模型开辟了可能。

关键词

引用

@article{arxiv.2110.01900,
  title  = {DistilHuBERT: Speech Representation Learning by Layer-wise Distillation of Hidden-unit BERT},
  author = {Heng-Jui Chang and Shu-wen Yang and Hung-yi Lee},
  journal= {arXiv preprint arXiv:2110.01900},
  year   = {2022}
}

备注

Accepted to ICASSP 2022