中文

语音处理的线性复杂度自监督学习

计算与语言 2024-07-19 v1 人工智能 音频与语音处理

摘要

自监督学习(SSL)模型通常需要数周的预训练,且使用数十块高端GPU。这些模型通常具有多头自注意力(MHSA)上下文编码器。然而,MHSA在输入长度上采用二次时间和空间,这导致高昂的预训练成本。MHSA的线性复杂度替代方案已被提出。例如,在监督训练中,SummaryMixing模型是首个在多个语音处理任务中超越MHSA的模型。然而,这些更便宜的替代方案尚未用于SSL。本文首次研究用于SSL的线性复杂度上下文编码器。对于MP3S基准的下游任务,SummaryMixing在更好或等效性能下,使wav2vec 2.0模型的预训练时间和峰值VRAM分别减少18%和23%,使使用4块Tesla A100 GPU完成155M wav2vec 2.0模型的预训练在一周内完成。代码可在https://github.com/SamsungLabs/SummaryMixing获取。

关键词

引用

@article{arxiv.2407.13377,
  title  = {Linear-Complexity Self-Supervised Learning for Speech Processing},
  author = {Shucong Zhang and Titouan Parcollet and Rogier van Dalen and Sourav Bhattacharya},
  journal= {arXiv preprint arXiv:2407.13377},
  year   = {2024}
}

备注

Interspeech 2024