深度学习与期望最大化融合的混响条件下空间线索语音分离
音频与语音处理
2021-03-01 v1
摘要
本文提出一种盲源分离(BSS)框架,该框架将基于U-Net的深度学习源分离网络与基于概率空间机器学习的期望最大化(EM)算法相集成,用于在混响条件下分离语音。我们所提出的模型使用预训练的深度学习卷积神经网络U-Net对双耳声级差(ILD)线索进行聚类,并使用机器学习期望最大化(EM)算法对双耳相位差(IPD)线索进行聚类。该集成模型利用了两种BSS方法的互补优势:有监督神经网络的强建模能力,以及无监督机器学习算法的简便性(其少量参数可仅基于一段音频混合片段进行估计)。结果表明,在从消声到真实世界中最常见混响条件的范围内,相较于基于EM的源分离算法MESSL-GS(基于模型的期望最大化源分离与定位含垃圾源),所提模型在信号失真比(SDR)上平均提升4.3 dB、在短时语音可懂度(STOI)上提升4.3%;相较于基于深度学习卷积神经网络(U-Net)的语音分离算法SONET,在SDR上提升4.5 dB、在STOI上提升8%。
引用
@article{arxiv.2102.13334,
title = {Integration of deep learning with expectation maximization for spatial cue based speech separation in reverberant conditions},
author = {Sania Gul and Muhammad Salman Khan and Syed Waqar Shah},
journal= {arXiv preprint arXiv:2102.13334},
year = {2021}
}