中文

WavLM:面向全栈语音处理的大规模自监督预训练

计算与语言 2022-11-23 v5 声音 音频与语音处理

摘要

自监督学习(SSL)在语音识别中取得了巨大成功,而针对其他语音处理任务的探索十分有限。由于语音信号包含多方面信息,包括说话人身份、副语言、口语内容等,为所有语音任务学习通用表征具有挑战性。为解决该问题,我们提出一种新的预训练模型 WavLM,以求解全栈下游语音任务。WavLM 在预训练中联合学习掩码语音预测与去噪。借此,WavLM 不仅通过掩码语音预测保持语音内容建模能力,还通过语音去噪提升在非 ASR 任务上的潜力。此外,WavLM 对 Transformer 结构采用门控相对位置偏置,以更好地捕捉输入语音的序列顺序。我们还将训练数据集从 60k 小时扩充至 94k 小时。WavLM Large 在 SUPERB 基准上取得最先进性能,并为各代表性基准上的多种语音处理任务带来显著改进。代码与预训练模型可在 https://aka.ms/wavlm 获取。

关键词

引用

@article{arxiv.2110.13900,
  title  = {WavLM: Large-Scale Self-Supervised Pre-Training for Full Stack Speech Processing},
  author = {Sanyuan Chen and Chengyi Wang and Zhengyang Chen and Yu Wu and Shujie Liu and Zhuo Chen and Jinyu Li and Naoyuki Kanda and Takuya Yoshioka and Xiong Xiao and Jian Wu and Long Zhou and Shuo Ren and Yanmin Qian and Yao Qian and Jian Wu and Michael Zeng and Xiangzhan Yu and Furu Wei},
  journal= {arXiv preprint arXiv:2110.13900},
  year   = {2022}
}

备注

Submitted to the Journal of Selected Topics in Signal Processing (JSTSP)