中文

面向混合语音的SA-WavLM:说话人感知自监督预训练

音频与语音处理 2024-07-04 v1

摘要

已证明,针对单说话人语音数据的自监督学习(SSL)预训练模型在各种下游语音任务中效果良好。然而,大多数此类模型在单说话人语音数据上训练,限制了其在混合语音中的效果。这促使我们探索在混合语音上进行预训练。本文提出SA-WavLM,一种用于混合语音的新型预训练模型。具体而言,SA-WavLM遵循“提取-合并-预测”管道,首先单独提取输入混合语音中每个说话人的表示,然后在最终预测前进行合并。在此管道中,SA-WavLM考虑到不同说话人之间的相互作用,进行说话人感知的提取。此外,本文提出一种说话人随机调换策略,以增强对说话人缺失的鲁棒性。实验表明,SA-WavLM要么匹配,要么优于当前最先进的预训练模型。

关键词

引用

@article{arxiv.2407.02826,
  title  = {SA-WavLM: Speaker-Aware Self-Supervised Pre-training for Mixture Speech},
  author = {Jingru Lin and Meng Ge and Junyi Ao and Liqun Deng and Haizhou Li},
  journal= {arXiv preprint arXiv:2407.02826},
  year   = {2024}
}

备注

InterSpeech 2024