中文

FurcaNet:一种用于单通道语音分离的深度门控卷积、长短期记忆深度神经网络端到端模型

声音 2019-03-19 v2 音频与语音处理

摘要

深度门控卷积网络已被证明在单通道语音分离中非常有效。然而当前最先进的框架通常考虑在时频(TF)域中训练门控卷积网络。这种方法会导致感知分数受限,例如分离语句的信噪比失真比(SDR)上界,并且也未能利用端到端框架。在本文中,我们提出一种集成式简单有效的单耳语音分离端到端方法,其由深度门控卷积神经网络(GCNN)组成,该网络接收两个说话人的混合语句并将其映射为两个分离语句,其中每个语句仅包含一个说话人的声音。此外,采用长短期记忆(LSTM)进行长期时间建模。对于目标函数,我们提出以置换不变训练(PIT)方式直接优化语句级 SDR 来训练网络。我们在公开 WSJ0-2mix 语料库上的实验表明,这一新方案能产生更具判别性的分离语句,并在说话人分离任务上带来性能提升。

关键词

引用

@article{arxiv.1902.00651,
  title  = {FurcaNet: An end-to-end deep gated convolutional, long short-term memory, deep neural networks for single channel speech separation},
  author = {Ziqiang Shi and Huibin Lin and Liu Liu and Rujie Liu and Shoji Hayakawa and Shouji Harada and Jiqing Han},
  journal= {arXiv preprint arXiv:1902.00651},
  year   = {2019}
}

备注

arXiv admin note: text overlap with arXiv:1902.00631