中文

MT4SSL:通过整合多目标提升自监督语音表征学习

计算与语言 2023-06-01 v3 人工智能 声音 音频与语音处理

摘要

本文从训练目标如何获取的角度,为自监督语音模型提供了新视角。我们将目标提取器泛化为离线目标提取器(Off-TE)与在线目标提取器(On-TE)。基于此,我们提出了一种用于自监督学习的多任务学习新框架MT4SSL,即通过整合多目标提升自监督语音表征学习(Boosting Self-Supervised Speech Representation Learning by Integrating Multiple Targets)。MT4SSL分别使用K-means算法作为Off-TE,以及无梯度的教师网络作为On-TE。我们的模型在LibriSpeech基准上以显著优势超越先前的SSL方法,且在使用更少数据的情况下可与性能最优的模型相媲美甚至更优。此外,我们发现同时使用Off-TE与On-TE能在预训练阶段带来更好的收敛性。兼具有效性与高效性,我们认为从我们的视角对自监督语音模型进行多任务学习是一个有前景的趋势。

关键词

引用

@article{arxiv.2211.07321,
  title  = {MT4SSL: Boosting Self-Supervised Speech Representation Learning by Integrating Multiple Targets},
  author = {Ziyang Ma and Zhisheng Zheng and Changli Tang and Yujin Wang and Xie Chen},
  journal= {arXiv preprint arXiv:2211.07321},
  year   = {2023}
}

备注

Accepted to Interspeech 2023. Code available at: https://github.com/ddlBoJack/MT4SSL