中文

用于从单通道语音混合中恢复目标说话人的深度提取网络

声音 2018-07-25 v1 音频与语音处理

摘要

说话人感知的源分离方法是解决任意源排列和未知源数目等主要困难的有前景的替代方案。然而,在可用的目标说话人语音片段(锚定语音)非常短的情况下,取得令人满意的性能仍然具有挑战性。本文提出一种新颖的“深度提取网络”,其在规范的高维嵌入空间中为目标说话人创建一个提取点,并将对应于目标说话人的时频块聚集在一起。所提出的模型与先前工作的不同之处在于,规范嵌入空间在端到端训练阶段编码了锚定语音和混合语音两者的知识:首先,在初始嵌入空间中分别构建锚定语音和混合语音的嵌入,然后将其组合作为前馈层的输入,以转换到我们发现比初始嵌入空间更稳定的规范嵌入空间。实验结果表明,在给定极短语音片段的情况下,所提出的模型能够高效地从混合语音中恢复高质量的目标语音,其性能优于多种基线模型,与基线预言深度吸引子(oracle deep attractor)模型相比,在SDR和PESQ上分别有5.2%和6.6%的相对提升。同时,我们表明其可以很好地泛化到多于一个干扰说话人的情况。

关键词

引用

@article{arxiv.1807.08974,
  title  = {Deep Extractor Network for Target Speaker Recovery From Single Channel Speech Mixtures},
  author = {Jun Wang and Jie Chen and Dan Su and Lianwu Chen and Meng Yu and Yanmin Qian and Dong Yu},
  journal= {arXiv preprint arXiv:1807.08974},
  year   = {2018}
}

备注

Accepted in Interspeech 2018