利用最小超球面能量改进 Wave-U-Net 的歌声分离
机器学习
2019-10-23 v1 声音
音频与语音处理
机器学习
摘要
近年来,深度学习已超越传统方法解决了歌声分离问题。Wave-U-Net 是一种直接在时域上运作的近期深度网络架构。标准 Wave-U-Net 采用数据增强与早停来防止过拟合。最小超球面能量(MHE)正则化近期已被证明可通过鼓励滤波器配置多样化来提升图像分类问题的泛化能力。在本工作中,我们将 MHE 正则化应用于 Wave-U-Net 的一维滤波器。我们在 MUSDB18 数据集上评估了该方法用于从混合音乐音频录音中分离人声部分的效果。我们发现,在损失函数中加入 MHE 正则化可稳定改善歌声分离效果(以测试录音上的信失真比衡量),从而得到了当前最佳的时域歌声提取系统。
关键词
引用
@article{arxiv.1910.10071,
title = {Improving singing voice separation with the Wave-U-Net using Minimum Hyperspherical Energy},
author = {Joaquin Perez-Lapillo and Oleksandr Galkin and Tillman Weyde},
journal= {arXiv preprint arXiv:1910.10071},
year = {2019}
}
备注
Paper submitted to ICASSP 2020 conference