Acappella:视听歌唱声音分离
声音
2021-10-20 v3 机器学习
音频与语音处理
摘要
在音乐视频中隔离目标歌唱声音的任务具有实用应用。在本工作中,我们从多模态视角探索单通道歌唱声音分离问题,通过联合从音频和视觉模态学习。为此,我们提出Acappella,一个源自YouTube、约46小时的无伴奏独唱视频数据集。我们还提出一种基于图的视听卷积网络,该网络在我们的数据集上取得了最先进的歌唱声音分离结果,并将其与仅音频对应的U-Net以及最先进的视听语音分离模型进行比较。我们在以下具有挑战性的设置中评估模型:i) 音频混合中存在重叠人声,ii) 目标声音在混音中音量较低,以及 iii) i) 和 ii) 的组合。第三种是最具挑战性的评估设置。我们证明我们的模型在最困难的评估设置下的歌唱声音分离任务中优于基线模型。代码、预训练模型以及数据集公开于 https://ipcv.github.io/Acappella/
引用
@article{arxiv.2104.09946,
title = {A cappella: Audio-visual Singing Voice Separation},
author = {Juan F. Montesinos and Venkatesh S. Kadandale and Gloria Haro},
journal= {arXiv preprint arXiv:2104.09946},
year = {2021}
}
备注
Paper accepted at The 32nd British Machine Vision Conference, BMVC 2021