中文

利用低失真目标估计改进语音增强

声音 2021-10-04 v1 音频与语音处理

摘要

一种有前景的多麦克风语音分离方法涉及两个深度神经网络(DNN),其中第一个 DNN 预测的目标语音用于计算时不变最小方差无失真响应(MVDR)波束形成的信号统计量,然后 MVDR 结果作为额外特征供第二个 DNN 预测目标语音。先前的研究表明,MVDR 结果可为第二个 DNN 提供互补信息以更好地预测目标语音。然而,在固定几何阵列上,两个 DNN 均可将例如多通道混合信号的实部和虚部(RI)分量作为特征,以利用空间与频谱信息进行增强。考虑到 DNN 与波束形成器使用相同输入,且 DNN 执行非线性滤波并可能使 MVDR 的线性滤波变得不必要,为何线性 MVDR 结果能互补且仍被需要并未得到清晰解释。类似地,在单通道情况下,可用单通道加权预测误差(WPE)滤波器替代 MVDR 波束形成器。尽管线性 WPE 滤波器与 DNN 使用相同的混合 RI 分量作为输入,却发现 WPE 结果显著改善了第二个 DNN。本研究从此类算法的低失真本质出发提供了一种新颖解释,并发现它们能一致地改善相位估计。基于这一理解,我们研究了若干低失真目标估计算法,包括若干波束形成器、WPE、前向卷积预测及其组合,并将其结果作为额外特征训练第二个网络以实现更好的增强。在单麦克风和麦克风语音去混响与增强任务上的评测结果表明了所提方法的有效性及所提观点的正确性。

关键词

引用

@article{arxiv.2110.00570,
  title  = {Leveraging Low-Distortion Target Estimates for Improved Speech Enhancement},
  author = {Zhong-Qiu Wang and Gordon Wichern and Jonathan Le Roux},
  journal= {arXiv preprint arXiv:2110.00570},
  year   = {2021}
}

备注

in submission