中文

Conv-TasNet 的实证研究

音频与语音处理 2020-02-25 v2 计算机视觉与模式识别 机器学习 声音

摘要

Conv-TasNet 是近年来提出的一种基于波形的深度神经网络,在语音源分离中达到了最先进的性能。其架构由一个可学习的编码器/解码器以及一个在该学习空间上运行的分离器组成。已有多种针对 Conv-TasNet 的改进被提出。然而,它们大多聚焦于分离器,将其编码器/解码器保留为(浅层)线性算子。在本文中,我们对 Conv-TasNet 进行了实证研究,并提出了一种基于其(深层)非线性变体的编码器/解码器增强方案。此外,我们使用更大且更多样的 LibriTTS 数据集进行实验,并研究了所研究模型在更大数据集上训练时的泛化能力。我们提出了跨数据集评估,包括评估来自 WSJ0-2mix、LibriTTS 和 VCTK 数据库的分离结果。我们的结果表明,对编码器/解码器的增强可将平均 SI-SNR 性能提升超过 1 dB。此外,我们提供了关于 Conv-TasNet 泛化能力及改进编码器/解码器潜在价值的见解。

关键词

引用

@article{arxiv.2002.08688,
  title  = {An empirical study of Conv-TasNet},
  author = {Berkan Kadioglu and Michael Horgan and Xiaoyu Liu and Jordi Pons and Dan Darcy and Vivek Kumar},
  journal= {arXiv preprint arXiv:2002.08688},
  year   = {2020}
}

备注

In proceedings of ICASSP2020