莫扎特之触:基于预训练大模型的轻量级多模态音乐生成框架
声音
2024-11-26 v3 人工智能
音频与语音处理
摘要
近年来,人工智能生成内容(AIGC)取得了快速发展,促进了音乐、图像和其他艺术形式在广泛行业中的创作。然而,当前的图像和视频到音乐合成模型难以捕捉视觉内容所传达的细微情感和氛围。为了填补这一空白,我们提出了Mozart's Touch,一个多模态音乐生成框架,能够生成与跨模态输入(如图像、视频和文本)对齐的音乐。该框架由三个关键组件组成:多模态字幕模块、大语言模型(LLM)理解与桥接模块,以及音乐生成模块。与传统的端到端方法不同,Mozart's Touch使用LLM准确解释视觉元素,无需训练或微调音乐生成模型,通过清晰、可解释的提示提供效率和透明度。我们还引入了“LLM-Bridge”方法来解决不同模态描述文本之间的异构表示挑战。通过一系列客观和主观评估,我们证明Mozart's Touch优于当前最先进的模型。我们的代码和示例可在https://github.com/TiffanyBlews/MozartsTouch获取。
引用
@article{arxiv.2405.02801,
title = {Mozart's Touch: A Lightweight Multi-modal Music Generation Framework Based on Pre-Trained Large Models},
author = {Jiajun Li and Tianze Xu and Xuesong Chen and Xinrui Yao and Shuchang Liu},
journal= {arXiv preprint arXiv:2405.02801},
year = {2024}
}
备注
10 pages, 2 figures, submitted to AIGC 2024