噪声环境下单通道多说话人语音分离的两阶段模型与最优SI-SNR
音频与语音处理
2020-08-04 v2 声音
摘要
在日常听音环境中,语音总是被背景噪声、房间混响和干扰说话人所失真。随着深度学习方法的进展,单通道多说话人语音分离取得了很大进步。然而,该领域多数研究聚焦于未考虑背景噪声与房间混响的实验室环境的简单问题设定。本文中,我们提出一种基于 conv-TasNet 的两阶段模型,以分别处理噪声与干扰说话人的显著影响,其中增强与分离依次使用深度扩张时间卷积网络(TCN)进行。此外,我们提出了一种称为最优尺度不变信噪比(OSI-SNR)的新目标函数,其在任何情况下均优于原始 SI-SNR。通过以 OSI-SNR 联合训练两阶段模型,我们的算法大幅优于单阶段分离基线。
引用
@article{arxiv.2004.06332,
title = {Two-stage model and optimal SI-SNR for monaural multi-speaker speech separation in noisy environment},
author = {Chao Ma and Dongmei Li and Xupeng Jia},
journal= {arXiv preprint arXiv:2004.06332},
year = {2020}
}
备注
This paper has been rejectted by INTERSPEECH 2020. It has been modified extensively and submitted to APSIPA ASC 2020