MedleyVox:一种用于多人歌声分离的评价数据集
声音
2023-05-05 v2 机器学习
音频与语音处理
摘要
将多个歌声分离为各自声部是音乐源分离研究中鲜有探讨的领域。缺乏基准数据集阻碍了其进展。本文提出一个评价数据集,并为多人歌声分离提供基线研究。首先,我们介绍 MedleyVox,一个用于多人歌声分离的评价数据集。我们通过将其分类为 i) 齐唱、ii) 二重唱、iii) 主唱与其他声部、以及 iv) N 人歌唱分离,来明确该数据集中的问题定义。其次,为克服现有多歌唱数据集在训练目的上的缺失,我们提出一种利用多种单歌唱数据集构建多人歌唱混合信号的策略。第三,我们提出改进超分辨率网络(iSRNet),其大幅增强了分离网络的初始估计。结合 Conv-TasNet 与多歌唱混合构建策略联合训练,所提出的 iSRNet 在 MedleyVox 的二重唱与齐唱子集上取得了与理想时频掩码相当的性能。音频样本、数据集与代码已发布于我们的网站(https://github.com/jeonchangbin49/MedleyVox)。
引用
@article{arxiv.2211.07302,
title = {MedleyVox: An Evaluation Dataset for Multiple Singing Voices Separation},
author = {Chang-Bin Jeon and Hyeongi Moon and Keunwoo Choi and Ben Sangbae Chon and Kyogu Lee},
journal= {arXiv preprint arXiv:2211.07302},
year = {2023}
}
备注
5 pages, 3 figures, 6 tables, To appear in ICASSP 2023 (camera-ready version)