基于深度神经网络的一致性感知多通道语音增强
音频与语音处理
2020-02-17 v1 声音
摘要
本文提出一种基于深度神经网络(DNN)的多通道语音增强系统,其中 DNN 被训练以最大化增强时域信号的质量。基于 DNN 的多通道语音增强常在时频(T-F)域进行,因为空间滤波可在 T-F 域高效实现。在此情形下,常规目标函数计算于估计的 T-F 掩码或频谱图上。然而,估计的频谱图常不一致,当其被转换回时域时,其幅度与相位可能改变。亦即,目标函数未能恰当地评估增强后的时域信号。为解决此问题,我们提出使用定义于重建时域信号上的目标函数。具体而言,语音增强通过在 T-F 域的多通道维纳滤波实现,其结果被转换回时域。我们提出两个计算于重建信号上的目标函数,其中第一个定义于时域,另一个定义于 T-F 域。我们的实验证明了所提系统相对于 T-F 掩码与基于掩码的波束形成的有效性。
引用
@article{arxiv.2002.05831,
title = {Consistency-aware multi-channel speech enhancement using deep neural networks},
author = {Yoshiki Masuyama and Masahito Togami and Tatsuya Komatsu},
journal= {arXiv preprint arXiv:2002.05831},
year = {2020}
}
备注
To appear at the 45th International Conference on Acoustics, Speech, and Signal Processing (ICASSP 2020)