降低自监督学习门槛:在学术计算资源下预训练 HuBERT
计算与语言
2023-06-13 v1 人工智能
音频与语音处理
摘要
自监督学习(SSL)已推动语音处理取得巨大进展。然而,随着这些模型规模持续扩大,训练所需资源已变得过于庞大。目前,仅有少数具备雄厚资源的团队能够构建 SSL 模型,这不利于可复现性。在本工作中,我们优化 HuBERT SSL 以适配学术资源限制。我们独立于原始实现复现了 HuBERT,且性能无损失。我们的代码与训练优化使得仅用 8 块 GPU 即可进行 SSL 训练,而非原始工作所用的 32 块。我们还探索了一条半监督路径,利用 ASR 模型跳过第一次预训练迭代。在仅一次预训练迭代内,我们的模型在多项任务上优于 HuBERT。此外,我们的 HuBERT Large 变体仅需 8 块 GPU,即取得与原始用 128 块 GPU 训练版本相近的性能。作为对社区的贡献,所有模型、配置与代码均在 ESPnet 中开源。
引用
@article{arxiv.2306.06672,
title = {Reducing Barriers to Self-Supervised Learning: HuBERT Pre-training with Academic Compute},
author = {William Chen and Xuankai Chang and Yifan Peng and Zhaoheng Ni and Soumi Maiti and Shinji Watanabe},
journal= {arXiv preprint arXiv:2306.06672},
year = {2023}
}
备注
Accepted at INTERSPEECH 2023