中文

SpEx:多尺度时域说话人提取网络

音频与语音处理 2020-04-20 v1 计算与语言 声音

摘要

说话人提取旨在从多说话人环境中提取目标说话人的语音,以模仿人类的选择性听觉注意。通常做法是在频域进行提取,并从提取的幅度和估计的相位谱重建时域信号。然而,这种方法受到相位估计固有难度的不利影响。受 Conv-TasNet 启发,我们提出了一种时域说话人提取网络(SpEx),它将混合语音转换为多尺度嵌入系数,而非将语音信号分解为幅度与相位谱。由此我们避免了相位估计。SpEx 网络由四个网络组件构成,即说话人编码器、语音编码器、说话人提取器和语音解码器。具体而言,语音编码器将混合语音转换为多尺度嵌入系数,说话人编码器学习用说话人嵌入表示目标说话人。说话人提取器以多尺度嵌入系数和目标说话人嵌入为输入并估计一个接收域掩码。最后,语音解码器从被掩码的嵌入系数重建目标说话人的语音。我们还提出了多任务学习框架与多尺度嵌入实现。实验结果表明,在开放评估条件下,所提 SpEx 相较最佳基线在信失真比(SDR)、尺度不变 SDR(SI-SDR)和语音质量感知评估(PESQ)上分别取得 37.3%、37.7% 和 15.0% 的相对提升。

关键词

引用

@article{arxiv.2004.08326,
  title  = {SpEx: Multi-Scale Time Domain Speaker Extraction Network},
  author = {Chenglin Xu and Wei Rao and Eng Siong Chng and Haizhou Li},
  journal= {arXiv preprint arXiv:2004.08326},
  year   = {2020}
}

备注

ACCEPTED in IEEE/ACM Transactions on Audio, Speech, and Language Processing (TASLP)