语音处理的线性复杂度自监督学习
计算与语言
2024-07-19 v1 人工智能
音频与语音处理
摘要
自监督学习(SSL)模型通常需要数周的预训练,且使用数十块高端GPU。这些模型通常具有多头自注意力(MHSA)上下文编码器。然而,MHSA在输入长度上采用二次时间和空间,这导致高昂的预训练成本。MHSA的线性复杂度替代方案已被提出。例如,在监督训练中,SummaryMixing模型是首个在多个语音处理任务中超越MHSA的模型。然而,这些更便宜的替代方案尚未用于SSL。本文首次研究用于SSL的线性复杂度上下文编码器。对于MP3S基准的下游任务,SummaryMixing在更好或等效性能下,使wav2vec 2.0模型的预训练时间和峰值VRAM分别减少18%和23%,使使用4块Tesla A100 GPU完成155M wav2vec 2.0模型的预训练在一周内完成。代码可在https://github.com/SamsungLabs/SummaryMixing获取。
引用
@article{arxiv.2407.13377,
title = {Linear-Complexity Self-Supervised Learning for Speech Processing},
author = {Shucong Zhang and Titouan Parcollet and Rogier van Dalen and Sourav Bhattacharya},
journal= {arXiv preprint arXiv:2407.13377},
year = {2024}
}
备注
Interspeech 2024