使用由理想二值掩码与交叉熵训练的深层卷积神经网络进行歌声分离
声音
2018-12-05 v1 人工智能
机器学习
音频与语音处理
机器学习
摘要
将歌声从其音乐伴奏中分离仍是音乐信息检索领域的重要挑战。我们提出一种独特的神经网络方法,其受已革新视觉领域的技术启发:逐像素图像分类,并将其与交叉熵损失以及将CNN作为自编码器在歌声谱图上的预训练相结合。逐像素分类技术直接估计我们谱图图像中每个时频(T-F)单元的声源标签,从而消除了常见的预处理与后处理任务。所提网络以理想二值掩码(IBM)作为目标输出标签进行训练。IBM通过将被混信号的幅度谱图中每个T-F单元视为具有多标签(对应每个声源)的像素,来识别每个T-F单元中的主导声源。交叉熵被用作训练目标,以最小化每个像素的目标标签与预测标签间的平均概率误差。通过将歌声分离问题视为逐像素分类任务,我们额外消除了常用但不易理解的后处理步骤之一:维纳滤波后处理。所提CNN在应用于iKala数据集时,以2.2702~5.9563 dB全局归一化源失真比(GNSDR)的增益优于音乐信息检索评估交流(MIREX)2016的亚军与MIREX 2014的冠军。在DSD100数据集上针对全轨歌曲评估任务的实验也表明,我们的模型能够与使用多通道建模、数据增强与模型融合的尖端歌声分离系统相竞争。
引用
@article{arxiv.1812.01278,
title = {Singing Voice Separation Using a Deep Convolutional Neural Network Trained by Ideal Binary Mask and Cross Entropy},
author = {Kin Wah Edward Lin and Balamurali B. T. and Enyan Koh and Simon Lui and Dorien Herremans},
journal= {arXiv preprint arXiv:1812.01278},
year = {2018}
}
备注
In Press, Neural Computing and Applications, Springer. 2019