中文

ADL-MVDR:面向目标语音分离的全深度学习MVDR波束形成器

音频与语音处理 2021-02-10 v3

摘要

语音分离算法常用于将目标语音从其他干扰源中分离出来。然而,纯神经网络驱动的语音分离系统常引起对自动语音识别(ASR)系统有害的非线性失真。传统的基于掩码的最小方差无失真响应(MVDR)波束形成器可用于最小化失真,但会带来较高水平的残留噪声。此外,传统 MVDR 解法中涉及的矩阵运算(如矩阵求逆)在与神经网络联合训练时,有时在数值上不稳定。本文中,我们提出一种新颖的全深度学习 MVDR 框架,用两个循环神经网络(RNNs)替代矩阵求逆与特征值分解,以同时解决上述两方面问题。所提方法借助 RNN 预测的逐帧波束形成权重,能在保持目标语音不失真的同时大幅降低残留噪声。该系统在一个普通话音视觉语料库上进行了评估,并与若干最先进(SOTA)语音分离系统进行比较。实验结果表明所提方法在多项客观指标与 ASR 准确率上具有优越性。

关键词

引用

@article{arxiv.2008.06994,
  title  = {ADL-MVDR: All deep learning MVDR beamformer for target speech separation},
  author = {Zhuohuang Zhang and Yong Xu and Meng Yu and Shi-Xiong Zhang and Lianwu Chen and Dong Yu},
  journal= {arXiv preprint arXiv:2008.06994},
  year   = {2021}
}

备注

Accepted to ICASSP 2021, 5 pages, 2 figures; Demos are available at https://zzhang68.github.io/adlmvdr/