中文

基于自监督学习的会议数据语音分离

音频与语音处理 2023-04-04 v1

摘要

在多方可会议场景下,语音分离可通过从重叠语音中提取单说话人信号来改善自动语音识别(ASR)。尽管自监督学习模型在单通道语音分离中取得了成功,但大多数研究集中于仿真设置。本文在仿真和真实语料库上比较了七种 SSL 模型。然后,我们提出通过一种新颖的迭代源选择方法,将性能最佳的模型 WavLM 集成到自动转写系统中。为提升真实场景性能,将时域无监督混合不变训练适配到时频域。实验表明,在转写系统中,当在基于分离语音微调的 ASR 模型前插入语音分离时,在 AMI 开发集和测试集上观察到未知说话人数下的拼接最小置换词错率(cpWER-us)分别绝对降低了 1.9% 和 1.5%。

关键词

引用

@article{arxiv.2304.00871,
  title  = {Self-Supervised Learning-Based Source Separation for Meeting Data},
  author = {Yuang Li and Xianrui Zheng and Philip C. Woodland},
  journal= {arXiv preprint arXiv:2304.00871},
  year   = {2023}
}

备注

To appear in Proc. ICASSP2023