TF-GridNet:融合全频带与子频带建模的语音分离方法
摘要
我们提出 TF-GridNet 用于语音分离。该模型是一种在时频(T-F)域中融合全频带与子频带建模的新型深度神经网络(DNN)。它堆叠多个块,每个块由帧内全频带模块、子频带时序模块和跨帧自注意力模块组成。模型训练执行复数谱映射,将输入信号的实部与虚部(RI)分量堆叠作为特征来预测目标 RI 分量。我们首先在无混响单通道说话人分离上评估它。在不使用数据增强和动态混合的情况下,它在标准双说话人分离数据集 WSJ0-2mix 上取得了 23.5 dB 尺度不变信号失真比(SI-SDR)的提升,达到最先进水平。为展示其对噪声与混响的鲁棒性,我们使用 SMS-WSJ 数据集在单通道混响说话人分离上、使用 WHAMR! 在噪声-混响说话人分离上评估它,并在两个数据集上均取得最先进性能。随后我们通过多麦克风复数谱映射将 TF-GridNet 扩展至多麦克风条件,并将其集成到一个带中间波束形成器的双 DNN 系统中(在早期研究中称为 MISO-BF-MISO),其中本文提出的波束形成器是基于第一个 DNN 输出计算的新型多帧维纳滤波器。在 SMS-WSJ 和 WHAMR! 的多通道任务上均取得最先进性能。除说话人分离外,我们将所提算法应用于语音去混响与噪声-混响语音增强。在去混响数据集和近期 L3DAS22 多通道语音增强挑战赛的数据集上均取得最先进性能。
引用
@article{arxiv.2211.12433,
title = {TF-GridNet: Integrating Full- and Sub-Band Modeling for Speech Separation},
author = {Zhong-Qiu Wang and Samuele Cornell and Shukjae Choi and Younglo Lee and Byeong-Yeol Kim and Shinji Watanabe},
journal= {arXiv preprint arXiv:2211.12433},
year = {2023}
}
备注
In IEEE/ACM Transactions on Audio, Speech, and Language Processing. A sound demo is available at https://zqwang7.github.io/demos/TF-GridNet-demo/index.html, and the code is available at https://github.com/espnet/espnet/pull/5395