中文

面向大规模多语言自监督学习的联合预测与去噪

计算与语言 2023-09-29 v2 人工智能 声音 音频与语音处理

摘要

多语言自监督学习(SSL)常因处理多种语言所需的开销与复杂性而落后于最先进(SOTA)方法。这进一步损害了 SSL 的可复现性,而其已因资源消耗而局限于少数研究组。我们表明更强大的技术实际上可带来更高效的预训练,使更多研究组能够开展 SSL。我们提出 WavLabLM,将 WavLM 的联合预测与去噪扩展至跨 136 种语言的 40k 小时数据。为构建 WavLabLM,我们设计了一种新颖的多阶段预训练方法,旨在解决多语言数据的语言不平衡问题。WavLabLM 以不到 10\% 的训练数据在 ML-SUPERB 上取得与 XLS-R 相当的性能,使 SSL 可在学术计算资源下实现。我们展示了使用原生 HuBERT Base 模型可进一步增效,其仅以 3\% 的数据、4 块 GPU 与有限试验即可保持 XLS-R 94\% 的性能。我们在 ESPnet 中开源了所有代码与模型。

关键词

引用

@article{arxiv.2309.15317,
  title  = {Joint Prediction and Denoising for Large-scale Multilingual Self-supervised Learning},
  author = {William Chen and Jiatong Shi and Brian Yan and Dan Berrebbi and Wangyou Zhang and Yifan Peng and Xuankai Chang and Soumi Maiti and Shinji Watanabe},
  journal= {arXiv preprint arXiv:2309.15317},
  year   = {2023}
}

备注

Accepted to ASRU 2023