探究带不同中间块的 U-Net 用于基于谱图的歌声分离
音频与语音处理
2020-10-09 v3 机器学习
多媒体
声音
机器学习
摘要
歌声分离(SVS)旨在从给定的混合音乐信号中分离出人声。近来,许多基于 U-Net 的模型被提出用于 SVS 任务,但尚无现有工作评估并比较可用于 U-Net 架构中的各类中间块。本文中,我们引入多种中间谱图变换块。我们基于这些块实现 U-Net,并在复值谱图上训练它们以同时考虑幅度与相位。随后这些网络在 SDR 指标上进行比较。当使用一种由卷积层与全连接层构成的特定块时,其在 MUSDB 歌声分离任务上以 0.9 dB 的大幅优势达到了最先进的 SDR。我们的代码与模型已在线提供。
引用
@article{arxiv.1912.02591,
title = {Investigating U-Nets with various Intermediate Blocks for Spectrogram-based Singing Voice Separation},
author = {Woosung Choi and Minseok Kim and Jaehwa Chung and Daewon Lee and Soonyoung Jung},
journal= {arXiv preprint arXiv:1912.02591},
year = {2020}
}
备注
8 pages 4 tables 6 figures, accepted to ISMIR 2020