中文

使用循环神经网络与置换不变训练对含噪多说话人语音进行联合分离与降噪

声音 2018-12-06 v1 音频与语音处理

摘要

本文提出使用话语级置换不变训练 (uPIT) 同时进行说话人无关的多说话人语音分离与降噪。具体而言,我们使用 uPIT 训练深度双向长短期记忆 (LSTM) 循环神经网络 (RNN),用于在多种含噪条件下(包括合成噪声与真实噪声信号)进行单通道说话人无关的多说话人语音分离。我们的实验重点关注依赖各类先验知识(如噪声类型和同时说话人数目)的模型的泛化能力与噪声鲁棒性。我们证明,在噪声环境中使用 uPIT 训练的深度双向 LSTM RNN 能够在说话人无关的多说话人语音分离与降噪任务上,针对各种噪声类型和信噪比 (SNR),提升信号失真比 (SDR) 以及扩展短时客观可懂度 (ESTOI) 指标。具体而言,我们首先表明,当使用已知噪声类型进行评估时,LSTM RNN 能够实现大幅的 SDR 和 ESTOI 提升,并且单个模型能够处理多种噪声类型,性能仅有轻微下降。此外,我们证明单个 LSTM RNN 能够处理两人和三人说话的含噪混合语音,无需关于说话人确切数目的先验知识。最后,我们证明使用 uPIT 训练的 LSTM RNN 能够很好地泛化到训练期间未见过的噪声类型。

关键词

引用

@article{arxiv.1708.09588,
  title  = {Joint Separation and Denoising of Noisy Multi-talker Speech using Recurrent Neural Networks and Permutation Invariant Training},
  author = {Morten Kolbæk and Dong Yu and Zheng-Hua Tan and Jesper Jensen},
  journal= {arXiv preprint arXiv:1708.09588},
  year   = {2018}
}

备注

To appear in MLSP 2017