利用深度 U-Net 与 Wave-U-Net 结合数据增强改进歌声分离
声音
2019-06-25 v1 音频与语音处理
摘要
最先进的歌声分离基于深度学习,利用带有跳跃连接的 CNN 结构(如 U-net 模型、Wave-U-Net 模型或 MSDENSELSTM)。这些模型成功的关键在于有大量训练数据可用。在以下研究中,我们关注单声道信号的歌声分离,并比较结构上相似但使用不同输入表示的 U-Net 与 Wave-U-Net。首先,我们报告了 U-Net 模型若干变体的结果。其次,我们讨论了利用最先进的语音与音乐变换算法扩充现有数据集的潜力,并表明这些增强的效果取决于模型所使用的信号表示。结果表明,两种模型均因增强而获得显著改进。但音高移调对 U-Net 模型是最有效的增强策略,而移调、时间拉伸与共振峰偏移对 Wave-U-Net 模型的影响则更为均衡。最后,我们在同一数据集上比较了这两个模型。
引用
@article{arxiv.1903.01415,
title = {Improving singing voice separation using Deep U-Net and Wave-U-Net with data augmentation},
author = {Alice Cohen-Hadria and Axel Roebel and Geoffroy Peeters},
journal= {arXiv preprint arXiv:1903.01415},
year = {2019}
}