基于内容并利用对齐音素强条件化的歌声源分离
音频与语音处理
2020-08-06 v1 机器学习
声音
摘要
随着神经网络的引入以及包含混合信号与分离源的大型多轨数据集的可用,知情源分离近来重新受到关注。这些方法利用关于目标源的先验信息来改善分离效果。历史上,音乐信息检索研究者主要关注乐谱知情源分离,但更近的方法探索歌词知情源分离。然而,由于缺乏带有时间对齐歌词的多轨数据集,模型使用带有非对齐歌词的弱条件化。在本文中,我们提出了一个多模态多轨数据集,其歌词在词级别与时间对齐并带有音素信息,同时探索使用对齐音素的强条件化。我们的模型遵循 U-Net 架构,以音乐混合信号的幅度谱图以及带有对齐音素信息的矩阵作为输入。音素矩阵被嵌入以获得控制特征线性调制(Feature-wise Linear Modulation, FiLM)层的参数。这些层通过仿射变换对 U-Net 特征图进行条件化,使分离过程适应不同音素的存在。我们表明音素条件化可成功应用于改善歌声源分离。
引用
@article{arxiv.2008.02070,
title = {Content based singing voice source separation via strong conditioning using aligned phonemes},
author = {Gabriel Meseguer-Brocal and Geoffroy Peeters},
journal= {arXiv preprint arXiv:2008.02070},
year = {2020}
}
备注
21st International Society for Music Information Retrieval Conference 11-15 October 2020, Montreal, Canada