基于音频查询的音乐源分离
声音
2019-08-20 v1 音频与语音处理
摘要
近年来,音乐源分离一直是音乐信息检索中研究最密集的领域之一。深度学习的进步使音乐源分离性能取得巨大进展。然而,以往大多数研究局限于分离少数有限数量的源,如人声、鼓、贝斯和其他。在本研究中,我们提出一种用于基于音频查询的音乐源分离的网络,无论目标信号的数量和/或种类如何,都能从查询信号中显式编码源信息。所提方法由 Query-net 和 Separator 组成:给定查询和混合信号,Query-net 将查询编码到潜空间,Separator 估计以潜向量为条件的掩码,然后将其应用于混合信号进行分离。Separator 也可使用来自训练样本的潜向量生成掩码,从而在缺少查询时进行分离。我们在 MUSDB18 数据集上评估我们的方法,实验结果表明所提方法可用单一网络分离多个源。此外,通过对潜空间的进一步探究,我们证明该方法可通过潜向量插值生成连续输出。
引用
@article{arxiv.1908.06593,
title = {Audio query-based music source separation},
author = {Jie Hwan Lee and Hyeong-Seok Choi and Kyogu Lee},
journal= {arXiv preprint arXiv:1908.06593},
year = {2019}
}
备注
8 pages, 7 figures, Appearing in the proceedings of the 20th International Society for Music Information Retrieval Conference (ISMIR 2019) (camera-ready version)