用于单通道说话人分离的掩码依赖相位估计
音频与语音处理
2020-04-16 v2
摘要
说话人分离是指在多说话人环境中隔离感兴趣的语音。大多数方法将实值时频(T-F)掩码应用于混合信号的短时傅里叶变换(STFT)以重建干净语音。因此,重建信号的相位与干净语音的原始相位之间存在不可避免的失配。本文中,我们提出了一种简单而有效的相位估计网络,基于 chimera++ 网络预测的 T-F 掩码来预测干净语音的相位。为克服 T-F 掩码和相位的标签排列问题,我们提出了掩码依赖的排列不变训练(PIT)准则,根据 T-F 掩码预测的损失来选择相位信号。我们还提出了一种用于相位预测的逆掩码加权损失函数,以使模型聚焦于相位更难预测的 T-F 区域。在 WSJ0-2mix 数据集上的结果表明,相位估计网络取得了与采用迭代相位重建或端到端时域损失函数的模型相当的性能,但方式更为直接。
引用
@article{arxiv.1911.02746,
title = {Mask-dependent Phase Estimation for Monaural Speaker Separation},
author = {Zhaoheng Ni and Michael I Mandel},
journal= {arXiv preprint arXiv:1911.02746},
year = {2020}
}
备注
Accepted by ICASSP 2020