中文

PARP:用于自监督语音识别的剪枝、调整与再剪枝

计算与语言 2021-10-27 v2 机器学习 声音 音频与语音处理

摘要

自监督语音表示学习(语音 SSL)已展示了在仅有有限配对数据(如 wav2vec 2.0)情况下为自动语音识别(ASR)学习丰富表示的规模效益。我们研究了预训练语音 SSL 模型中是否存在稀疏子网络,能够实现更好的低资源 ASR 结果。然而,直接应用广泛采用的剪枝方法(如彩票假设(LTH))在计算成本上并非最优。此外,我们表明所发现的子网络相较于原始稠密网络带来的性能提升极小。我们提出剪枝-调整-再剪枝(PARP),其发现并微调子网络以获得远更好的性能,同时仅需一次下游 ASR 微调运行。PARP 的灵感来自于我们的一个惊人观察:为预训练任务剪枝出的子网络仅需轻微调整即可在下游 ASR 任务中实现可观的性能提升。在低资源 ASR 上的大量实验验证了 (1) 单语/多语预训练语音 SSL 中存在稀疏子网络,以及 (2) PARP 相对于基线剪枝方法的计算优势与性能提升。特别是在无 LM 解码的 10 分钟 Librispeech 划分上,PARP 从 wav2vec 2.0 中发现的子网络相较全模型实现了绝对的 10.9%/12.6% WER 下降。我们进一步通过以下方式展示 PARP 的有效性:跨语言剪枝而不产生任何音素识别退化、在一次微调运行中为 10 种口语发现多语子网络,以及其对预训练 BERT/XLNet 在自然语言任务上的适用性。

关键词

引用

@article{arxiv.2106.05933,
  title  = {PARP: Prune, Adjust and Re-Prune for Self-Supervised Speech Recognition},
  author = {Cheng-I Jeff Lai and Yang Zhang and Alexander H. Liu and Shiyu Chang and Yi-Lun Liao and Yung-Sung Chuang and Kaizhi Qian and Sameer Khurana and David Cox and James Glass},
  journal= {arXiv preprint arXiv:2106.05933},
  year   = {2021}
}