中文

基于大规模自监督学习的语音分离

音频与语音处理 2022-11-29 v2 计算与语言 声音

摘要

自监督学习(SSL)方法如 WavLM 已在小规模基于仿真的实验中展现出有前景的语音分离(SS)结果。本工作中,我们通过大规模扩展预训练数据(超过 300K 小时)与微调数据(10K 小时)来拓展对基于 SSL 的语音分离的探索。我们还研究了在有限计算预算下将预训练模型高效集成到 SS 网络中的多种技术,包括低帧率 SSL 模型训练设置以及仅使用预训练模型部分进行微调的方案。与纯监督基线以及使用先前发布的 94K 小时训练 WavLM 所得特征嵌入的基于 WavLM 的 SS 模型相比,我们提出的模型在仿真远场语音混合测试集上分别获得了 15.9% 与 11.2% 的相对词错误率(WER)降低。对于使用连续语音分离的真实会议录音转写,所提模型在 AMI 与 ICSI 评测集上相较纯监督基线分别实现了 6.8% 与 10.6% 的相对 WER 降低,同时将计算成本降低了 38%。

关键词

引用

@article{arxiv.2211.05172,
  title  = {Speech separation with large-scale self-supervised learning},
  author = {Zhuo Chen and Naoyuki Kanda and Jian Wu and Yu Wu and Xiaofei Wang and Takuya Yoshioka and Jinyu Li and Sunit Sivasankaran and Sefik Emre Eskimez},
  journal= {arXiv preprint arXiv:2211.05172},
  year   = {2022}
}