基于视觉条件的音乐混音
声音
2020-10-29 v1 多媒体
音频与语音处理
摘要
我们通过结合深度视觉和音频模型,提出了一种视觉条件的音乐混音系统。该方法基于最先进的视听源分离模型,该模型利用视频信息进行乐器源分离。我们修改了该模型,使其在推理过程中使用用户选择的图像而非视频作为视觉输入,从而实现对纯音频内容的分离。此外,我们提出了一种混音引擎,将源分离任务推广到音乐混音。与使用最先进的视听源分离模型通过分离再相加方法执行的混音相比,所提方法能够实现更好的音频质量。
引用
@article{arxiv.2010.14565,
title = {Remixing Music with Visual Conditioning},
author = {Li-Chia Yang and Alexander Lerch},
journal= {arXiv preprint arXiv:2010.14565},
year = {2020}
}