中文

Fast-HuBERT:一种高效的自监督语音表征学习训练框架

计算与语言 2023-10-02 v2 人工智能 机器学习 声音 音频与语音处理

摘要

近年来,用于语音处理任务的自监督学习(SSL)方法取得了显著进展。各类基于语音的SSL模型已被开发出来,并在包括语音识别在内的一系列下游任务上展现出良好性能。然而,现有的基于语音的SSL模型普遍面临计算成本方面的困境,这可能阻碍其潜在应用与深入学术研究。为解决此问题,我们首先分析了HuBERT预训练期间各模块的计算成本,随后引入一组效率优化,本文称之为Fast-HuBERT。所提Fast-HuBERT可在8块V100 GPU上以Librispeech 960h基准训练1.1天,且性能不退化,相较原始实现实现了5.2倍加速。此外,我们在Fast-HuBERT中探索了两种被广泛研究的技术,并展现出与先前工作一致的改进。

关键词

引用

@article{arxiv.2309.13860,
  title  = {Fast-HuBERT: An Efficient Training Framework for Self-Supervised Speech Representation Learning},
  author = {Guanrou Yang and Ziyang Ma and Zhisheng Zheng and Yakun Song and Zhikang Niu and Xie Chen},
  journal= {arXiv preprint arXiv:2309.13860},
  year   = {2023}
}