DPCCN:用于鲁棒语音分离与提取的密集连接金字塔复卷积网络
音频与语音处理
2022-02-01 v2
摘要
近年来,已提出多种时域语音分离方法。然而,它们大多对环境及广域覆盖任务非常敏感。本文从时频域视角出发,提出一种密集连接金字塔复卷积网络,称为 DPCCN,以提升复杂条件下语音分离的鲁棒性。此外,我们通过集成一个新专门设计的说话人编码器,将 DPCCN 推广至目标语音提取(TSE)。同时,我们还探究了 DPCCN 对无监督跨域 TSE 任务的鲁棒性。提出一种 Mixture-Remix 方法,以适配目标域声学特性来微调源模型。我们所提方法不仅在含噪与混响同域条件下评估,也在干净但跨域条件下评估。结果表明,对于语音分离与提取,基于 DPCCN 的系统均取得显著更优的性能与鲁棒性,优于当前主导的时域方法,尤其在跨域任务上。特别地,我们发现采用 DPCCN 的 Mixture-Remix 微调在无监督跨域 TSE 上显著优于 TD-SpeakerBeam,在目标域测试集上 SISNR 提升约 3.5 dB,且源域性能无任何下降。
引用
@article{arxiv.2112.13520,
title = {DPCCN: Densely-Connected Pyramid Complex Convolutional Network for Robust Speech Separation And Extraction},
author = {Jiangyu Han and Yanhua Long and Lukas Burget and Jan Cernocky},
journal= {arXiv preprint arXiv:2112.13520},
year = {2022}
}
备注
accepted by ICASSP 2022