中文

用于目标语音分离的多通道多帧ADL-MVDR方法

音频与语音处理 2021-11-17 v2 声音

摘要

许多纯神经网络语音分离方法被提出以提升客观评估分数,但它们常引入对现代自动语音识别(ASR)系统有害的非线性失真。最小方差无失真响应(MVDR)滤波器常被采用以消除非线性失真,然而传统的基于神经掩码的 MVDR 系统仍导致相对较高的残留噪声水平。此外,MVDR 解中涉及的矩阵求逆在与神经网络联合训练时有时数值不稳定。在本研究中,我们提出一种用于目标语音分离的多通道多帧(MCMF)全深度学习(ADL)-MVDR 方法,其扩展了我们初步的多通道 ADL-MVDR 方法。所提出的 MCMF ADL-MVDR 系统处理了线性与非线性失真。时空互相关性也在所提方法中被充分利用。所提系统使用普通话视听语料库进行评估,并与几种最先进的方法进行比较。实验结果证明了我们所提系统在不同场景及多个客观评估指标(包括 ASR 性能)下的优越性。

关键词

引用

@article{arxiv.2012.13442,
  title  = {Multi-channel Multi-frame ADL-MVDR for Target Speech Separation},
  author = {Zhuohuang Zhang and Yong Xu and Meng Yu and Shi-Xiong Zhang and Lianwu Chen and Donald S. Williamson and Dong Yu},
  journal= {arXiv preprint arXiv:2012.13442},
  year   = {2021}
}

备注

Accepted by IEEE/ACM Transactions on Audio, Speech, and Language Processing (TASLP); Demos available at https://zzhang68.github.io/mcmf-adl-mvdr/