单声道源分离中掩码与深度循环神经网络的联合优化
声音
2015-10-02 v4 人工智能
机器学习
多媒体
摘要
单声道源分离对于许多现实世界的应用至关重要。由于仅有一个通道的信息可用且无任何约束,存在无限多种可能的解,因此该任务极具挑战性。在本文中,我们探讨了掩码函数与深度循环神经网络在单声道源分离任务(包括单声道语音分离、单声道歌声分离和语音去噪)中的联合优化。将深度循环神经网络与额外的掩码层进行联合优化,强制执行了重构约束。此外,我们探索了一种用于训练神经网络的判别准则,以进一步提升分离性能。我们分别在 TSP、MIR-1K 和 TIMIT 数据集上评估了所提出的系统,用于语音分离、歌声分离和语音去噪任务。我们的方法在语音分离任务中相比 NMF 模型取得了 2.30--4.98 dB 的 SDR 增益,在歌声分离任务中相比现有模型取得了 2.30--2.48 dB 的 GNSDR 增益和 4.32--5.42 dB 的 GSIR 增益,并在语音去噪任务中优于 NMF 和 DNN 基线模型。
引用
@article{arxiv.1502.04149,
title = {Joint Optimization of Masks and Deep Recurrent Neural Networks for Monaural Source Separation},
author = {Po-Sen Huang and Minje Kim and Mark Hasegawa-Johnson and Paris Smaragdis},
journal= {arXiv preprint arXiv:1502.04149},
year = {2015}
}