MeLFusion:基于扩散模型的图像与语言线索音乐合成
计算机视觉与模式识别
2024-06-10 v1 人工智能
多媒体
音频与语音处理
摘要
音乐是一种普遍的语言,可传递情感与情绪。它构成整个创意媒介谱系(从电影到社交媒体帖子)的重要组成部分。目前能够合成音乐的机器学习模型主要以文本描述为条件。鼓舞于音乐家不仅通过电影剧本,还通过可视化创作音乐的事实,我们提出MeLFusion,一种能够有效利用文本描述和对应图像线索合成音乐的模型。MeLFusion是一种文本到音乐扩散模型,具备新颖的“视觉突触”,有效将视觉模态语义注入生成的音乐中。为促进该领域的研究,我们引入了新数据集MeLBench,并提出了新的评估指标IMSM。我们的详尽实验评估表明,将视觉信息纳入音乐合成管道显著提高了生成音乐的质量,客观与主观评估均表明提升幅度可达67.98%。我们希望本工作能引起对这一务实且相对缺乏关注的研究领域的重视。
引用
@article{arxiv.2406.04673,
title = {MeLFusion: Synthesizing Music from Image and Language Cues using Diffusion Models},
author = {Sanjoy Chowdhury and Sayan Nag and K J Joseph and Balaji Vasan Srinivasan and Dinesh Manocha},
journal= {arXiv preprint arXiv:2406.04673},
year = {2024}
}
备注
Accepted at CVPR 2024 as Highlight paper. Webpage: https://schowdhury671.github.io/melfusion_cvpr2024/