SpEx+:一种完备的时域说话人提取网络
音频与语音处理
2020-08-19 v2 声音
摘要
说话人提取旨在给定目标说话人参考语音的情况下,从多人交谈环境中提取出目标语音信号。我们近期提出了一种时域解决方案 SpEx,其避免了频域方法中的相位估计。遗憾的是,SpEx 并非完全的时域方案,因为它在执行时域语音编码以进行说话人提取的同时,采用频域说话人嵌入作为参考。且时域分析窗大小与频域输入大小亦不相同。这种不匹配会对系统性能产生不利影响。为消除该不匹配,我们提出了一种完备的时域说话人提取方案,称为 SpEx+。具体而言,我们将两个相同的语音编码器网络的权重绑定,其中一个用于编码器-提取器-解码器流水线,另一个作为说话人编码器的一部分。实验表明,在 WSJ0-2mix-extr 数据库的不同性别与相同性别条件下,SpEx+ 分别比最先进的 SpEx 基线实现了 0.8dB 和 2.1dB 的 SDR 提升。
引用
@article{arxiv.2005.04686,
title = {SpEx+: A Complete Time Domain Speaker Extraction Network},
author = {Meng Ge and Chenglin Xu and Longbiao Wang and Eng Siong Chng and Jianwu Dang and Haizhou Li},
journal= {arXiv preprint arXiv:2005.04686},
year = {2020}
}
备注
accepted in INTERSPEECH 2020