Conv-TasNet 的实证研究
音频与语音处理
2020-02-25 v2 计算机视觉与模式识别
机器学习
声音
摘要
Conv-TasNet 是近年来提出的一种基于波形的深度神经网络,在语音源分离中达到了最先进的性能。其架构由一个可学习的编码器/解码器以及一个在该学习空间上运行的分离器组成。已有多种针对 Conv-TasNet 的改进被提出。然而,它们大多聚焦于分离器,将其编码器/解码器保留为(浅层)线性算子。在本文中,我们对 Conv-TasNet 进行了实证研究,并提出了一种基于其(深层)非线性变体的编码器/解码器增强方案。此外,我们使用更大且更多样的 LibriTTS 数据集进行实验,并研究了所研究模型在更大数据集上训练时的泛化能力。我们提出了跨数据集评估,包括评估来自 WSJ0-2mix、LibriTTS 和 VCTK 数据库的分离结果。我们的结果表明,对编码器/解码器的增强可将平均 SI-SNR 性能提升超过 1 dB。此外,我们提供了关于 Conv-TasNet 泛化能力及改进编码器/解码器潜在价值的见解。
引用
@article{arxiv.2002.08688,
title = {An empirical study of Conv-TasNet},
author = {Berkan Kadioglu and Michael Horgan and Xiaoyu Liu and Jordi Pons and Dan Darcy and Vivek Kumar},
journal= {arXiv preprint arXiv:2002.08688},
year = {2020}
}
备注
In proceedings of ICASSP2020