中文

基于展开式迭代相位重构的端到端语音分离

声音 2018-04-30 v1 计算与语言 机器学习 音频与语音处理 机器学习

摘要

本文提出一种单通道、说话人无关的 multi-speaker 语音分离的端到端方法,其中时频(T-F)掩蔽、短时傅里叶变换(STFT)及其逆变换被表示为深度网络中的层。以往的方法不对重构信号计算损失,而是使用基于目标 STFT 幅度的替代损失,这忽略了由相位不一致引入的重构误差。在我们的方法中,损失函数直接定义在重构信号上,这些信号被优化以获得最佳分离。此外,我们通过相位重构算法的展开迭代进行训练,该算法表示为一系列 STFT 和逆 STFT 层。对于使用混合相位进行重构的方法,掩蔽值通常限制在零到一之间,但如果估计的幅度将与相位重构一起使用,此限制则不太相关。因此我们提出几种用于 T-F 掩蔽输出层的新颖激活函数,以允许掩蔽值大于一。在公开可用的 wsj0-2mix 数据集上,我们的方法取得了最先进的 12.6 dB 尺度不变信号失真比(SI-SDR)和 13.1 dB SDR,揭示了基于深度学习的相位重构的新可能,并代表了向解决臭名昭著的鸡尾酒会问题迈出的基础性进展。

关键词

引用

@article{arxiv.1804.10204,
  title  = {End-to-End Speech Separation with Unfolded Iterative Phase Reconstruction},
  author = {Zhong-Qiu Wang and Jonathan Le Roux and DeLiang Wang and John R. Hershey},
  journal= {arXiv preprint arXiv:1804.10204},
  year   = {2018}
}

备注

Submitted to Interspeech 2018