中文

SpEx+:一种完备的时域说话人提取网络

音频与语音处理 2020-08-19 v2 声音

摘要

说话人提取旨在给定目标说话人参考语音的情况下,从多人交谈环境中提取出目标语音信号。我们近期提出了一种时域解决方案 SpEx,其避免了频域方法中的相位估计。遗憾的是,SpEx 并非完全的时域方案,因为它在执行时域语音编码以进行说话人提取的同时,采用频域说话人嵌入作为参考。且时域分析窗大小与频域输入大小亦不相同。这种不匹配会对系统性能产生不利影响。为消除该不匹配,我们提出了一种完备的时域说话人提取方案,称为 SpEx+。具体而言,我们将两个相同的语音编码器网络的权重绑定,其中一个用于编码器-提取器-解码器流水线,另一个作为说话人编码器的一部分。实验表明,在 WSJ0-2mix-extr 数据库的不同性别与相同性别条件下,SpEx+ 分别比最先进的 SpEx 基线实现了 0.8dB 和 2.1dB 的 SDR 提升。

关键词

引用

@article{arxiv.2005.04686,
  title  = {SpEx+: A Complete Time Domain Speaker Extraction Network},
  author = {Meng Ge and Chenglin Xu and Longbiao Wang and Eng Siong Chng and Jianwu Dang and Haizhou Li},
  journal= {arXiv preprint arXiv:2005.04686},
  year   = {2020}
}

备注

accepted in INTERSPEECH 2020