LibriMix: 一个用于可泛化语音分离的开源数据集
音频与语音处理
2020-05-25 v1
摘要
近年来,wsj0-2mix已成为单通道语音分离的基准数据集。当今大多数基于深度学习的语音分离模型都在该数据集上进行基准测试。然而,近期研究表明,在wsj0-2mix上训练的模型在其他类似数据集上评估时,性能会出现显著下降。为了解决这种泛化问题,我们创建了LibriMix,它是wsj0-2mix及其带噪扩展WHAM!的开源替代方案。LibriMix基于LibriSpeech,由两说话人或三说话人混合语音与来自WHAM!的环境噪声样本组合而成。使用Conv-TasNet,我们在所有版本的LibriMix上都取得了有竞争力的性能。为了在不同数据集之间进行公平评估,我们引入了第三个测试集,其语音来自VCTK,噪声来自WHAM!。我们的实验表明,在纯净和带噪条件下,使用LibriMix训练的模型比使用WHAM!训练的模型具有更小的泛化误差。为了在更真实、类似对话的场景中进行评估,我们还发布了LibriMix测试集的一个稀疏重叠版本。
引用
@article{arxiv.2005.11262,
title = {LibriMix: An Open-Source Dataset for Generalizable Speech Separation},
author = {Joris Cosentino and Manuel Pariente and Samuele Cornell and Antoine Deleforge and Emmanuel Vincent},
journal= {arXiv preprint arXiv:2005.11262},
year = {2020}
}
备注
submitted to INTERSPEECH 2020