带显式桥接和检索增强的多模态音乐生成
计算机视觉与模式识别
2024-12-13 v1 多媒体
声音
音频与语音处理
摘要
多模态音乐生成旨在从多样化的输入模态(包括文本、视频和图像)生成音乐。现有方法在多模态融合中使用通用嵌入空间。尽管在其他模态上效果良好,但其在多模态音乐生成中的应用面临数据稀缺、跨模态对齐较弱以及可控性有限的挑战。本文通过使用文本和音乐的显式桥接来解决这些问题,实现多模态对齐。我们引入一种新方法,称为Visuals Music Bridge(VMB)。具体而言,一个多模态音乐描述模型将视觉输入转换为详细的文本描述,以提供文本桥接;一个双轨音乐检索模块结合广泛和针对性检索策略,以提供音乐桥接并实现用户控制。最后,我们设计了一个显式条件音乐生成框架,基于这两个桥接生成音乐。我们在视频到音乐、图像到音乐、文本到音乐以及可控音乐生成任务上开展实验,并进行可控性实验。结果表明,VMB显著提高了音乐质量、模态性和自定义对齐,相对于以前的方法具有优势。VMB为具有各种多媒体应用的可解释且富有表现力的多模态音乐生成设定了新的标准。演示和代码均可在https://github.com/wbs2788/VMB上获取。
引用
@article{arxiv.2412.09428,
title = {Multimodal Music Generation with Explicit Bridges and Retrieval Augmentation},
author = {Baisen Wang and Le Zhuo and Zhaokai Wang and Chenxi Bao and Wu Chengjing and Xuecheng Nie and Jiao Dai and Jizhong Han and Yue Liao and Si Liu},
journal= {arXiv preprint arXiv:2412.09428},
year = {2024}
}