基于掩码波束形成的有监督语音源分离多通道损失函数
声音
2019-07-12 v1 音频与语音处理
摘要
在本文中,我们提出两种使用由多通道损失函数训练的深层神经网络(DNN)的基于掩码的波束形成方法。利用 DNN 估计的时频(TF)掩码进行波束形成技术已应用于许多场景,其中 TF 掩码用于估计空间协方差矩阵。为训练用于基于掩码波束形成的 DNN,采用了为单通道语音增强/分离设计的损失函数。尽管这种训练准则简单,但它并不直接对应于基于掩码波束形成的性能。为克服该问题,我们使用基于多通道 Itakura--Saito 散度评估估计空间协方差矩阵的多通道损失函数。由多通道损失函数训练的 DNN 可应用于构建若干波束形成器。实验结果证实了它们的有效性及对麦克风配置的鲁棒性。
引用
@article{arxiv.1907.04984,
title = {Multichannel Loss Function for Supervised Speech Source Separation by Mask-based Beamforming},
author = {Yoshiki Masuyama and Masahito Togami and Tatsuya Komatsu},
journal= {arXiv preprint arXiv:1907.04984},
year = {2019}
}
备注
5 pages, Accepted at INTERSPEECH 2019