中文

TF-GridNet:让时频域模型在单通道说话人分离中重放异彩

声音 2023-03-16 v2 音频与语音处理

摘要

我们提出TF-GridNet,一种在时频(T-F)域运行的新型多路径深度神经网络(DNN),用于无混响条件下与说话人无关的单通道说话人分离。该模型堆叠多个多路径块,每块由帧内频谱模块、子带时域模块和全带自注意力模块组成,以利用局部与全局谱-时信息实现分离。模型训练执行复频谱映射,将输入混合信号的实部与虚部(RI)分量堆叠为输入特征以预测目标RI分量。除使用尺度不变信失真比(SI-SDR)损失训练模型外,我们引入一项新颖损失项以促使分离出的源相加等于输入混合信号。在未使用动态混合的情况下,我们在WSJ0-2mix数据集上取得23.4 dB SI-SDR提升(SI-SDRi),大幅优于先前最佳结果。

关键词

引用

@article{arxiv.2209.03952,
  title  = {TF-GridNet: Making Time-Frequency Domain Models Great Again for Monaural Speaker Separation},
  author = {Zhong-Qiu Wang and Samuele Cornell and Shukjae Choi and Younglo Lee and Byeong-Yeol Kim and Shinji Watanabe},
  journal= {arXiv preprint arXiv:2209.03952},
  year   = {2023}
}

备注

in IEEE ICASSP 2023