基于自注意力卷积神经网络的音乐人声与伴奏分离
音频与语音处理
2020-03-23 v1 机器学习
声音
机器学习
摘要
音乐源分离数十年来一直是信号处理领域的热门课题,不仅因其技术难度,也因其在自动卡拉OK和混音等许多商业应用中的重要价值。本工作中,我们提出一种新颖的自注意力网络来分离音乐中的人声与伴奏。首先,构建一个带有密集连接CNN块的卷积神经网络(CNN)作为基础网络。随后,在基础CNN的不同层级插入自注意力子网络,以利用音乐的长程内部依赖关系,即重复性。在自注意力子网络内,相同音乐模式的重复为其他重复段的重建提供信息,从而获得更好的源分离性能。结果表明,所提方法在人声分离上相对于SOTA取得了19.5%的SDR相对提升。我们将方法与最先进的系统MMDenseNet和MMDenseLSTM进行了比较。
引用
@article{arxiv.2003.08954,
title = {Voice and accompaniment separation in music using self-attention convolutional neural network},
author = {Yuzhou Liu and Balaji Thoshkahna and Ali Milani and Trausti Kristjansson},
journal= {arXiv preprint arXiv:2003.08954},
year = {2020}
}