中文

基于掩码波束形成的有监督语音源分离多通道损失函数

声音 2019-07-12 v1 音频与语音处理

摘要

在本文中,我们提出两种使用由多通道损失函数训练的深层神经网络(DNN)的基于掩码的波束形成方法。利用 DNN 估计的时频(TF)掩码进行波束形成技术已应用于许多场景,其中 TF 掩码用于估计空间协方差矩阵。为训练用于基于掩码波束形成的 DNN,采用了为单通道语音增强/分离设计的损失函数。尽管这种训练准则简单,但它并不直接对应于基于掩码波束形成的性能。为克服该问题,我们使用基于多通道 Itakura--Saito 散度评估估计空间协方差矩阵的多通道损失函数。由多通道损失函数训练的 DNN 可应用于构建若干波束形成器。实验结果证实了它们的有效性及对麦克风配置的鲁棒性。

关键词

引用

@article{arxiv.1907.04984,
  title  = {Multichannel Loss Function for Supervised Speech Source Separation by Mask-based Beamforming},
  author = {Yoshiki Masuyama and Masahito Togami and Tatsuya Komatsu},
  journal= {arXiv preprint arXiv:1907.04984},
  year   = {2019}
}

备注

5 pages, Accepted at INTERSPEECH 2019