中文

LightHuBERT:基于一次训练全用隐单元BERT的轻量可配置语音表征学习

音频与语音处理 2022-06-22 v2 计算与语言 机器学习 声音

摘要

自监督语音表征学习已在各类语音处理任务中展现出有前景的结果。然而,预训练模型(如HuBERT)是存储密集的Transformer,限制了其在低资源环境下的应用范围。为此,我们提出LightHuBERT,一种一次训练全用(once-for-all)的Transformer压缩框架,通过结构化参数剪枝自动寻找所需架构。更确切地说,我们构建一个基于Transformer的超网,其中嵌套数千个权重共享子网络,并设计两阶段蒸馏策略以利用HuBERT的上下文潜在表征。在自动语音识别(ASR)与SUPERB基准上的实验表明,所提出的LightHuBERT支持超过10910^9种涉及嵌入维度、注意力维度、头数、前馈网络比例和网络深度的架构。LightHuBERT在ASR和五项SUPERB任务上以HuBERT大小超越原始HuBERT,在以29%参数削减下于多数任务取得与教师模型相当的性能,并在三项SUPERB任务(如自动说话人验证、关键词 spotting和意图分类)中获得3.5×3.5\times压缩比,且精度损失轻微。代码与预训练模型见https://github.com/mechanicalsea/lighthubert。

关键词

引用

@article{arxiv.2203.15610,
  title  = {LightHuBERT: Lightweight and Configurable Speech Representation Learning with Once-for-All Hidden-Unit BERT},
  author = {Rui Wang and Qibing Bai and Junyi Ao and Long Zhou and Zhixiang Xiong and Zhihua Wei and Yu Zhang and Tom Ko and Haizhou Li},
  journal= {arXiv preprint arXiv:2203.15610},
  year   = {2022}
}

备注

5 pages, 2 figures, accepted to Insterspeech 2022