FilmComposer: 基于大语言模型的静音电影片段音乐创作
计算机视觉与模式识别
2025-03-12 v1 多媒体
声音
音频与语音处理
摘要
在本工作中,我们实现了利用大语言模型驱动的方法为静音电影片段进行音乐创作。鉴于电影音乐制作对专业性要求较高,我们提出了 FilmComposer,模拟专业音乐家的实际工作流程。FilmComposer 首次将大型生成模型与多智能体方法相结合,利用波形音乐与符号音乐生成各自的优势。此外,FilmComposer 首次聚焦于电影音乐创作的三个核心要素——音频质量、音乐性与音乐发展——并引入节奏、语义和视觉等多种控制手段以增强这些关键方面。具体而言,FilmComposer 由视觉处理模块、可控节奏的 MusicGen 以及多智能体评估、编曲与混音组成。此外,我们的框架可以无缝集成到实际音乐制作流程中,并允许用户在每一步进行干预,从而提供强大的交互性和高度的创作自由度。此外,我们提出了 MusicPro-7k 数据集,包含 7,418 个电影片段、音乐、描述、节奏点和主旋律,以弥补专业高质量电影音乐数据集的匮乏。最后,标准指标和我们提出的新专用指标均表明,我们模型生成的音乐在质量、与视频的一致性、多样性、音乐性和音乐发展方面达到了最先进的性能。项目页面:https://apple-jun.github.io/FilmComposer.github.io/
引用
@article{arxiv.2503.08147,
title = {FilmComposer: LLM-Driven Music Production for Silent Film Clips},
author = {Zhifeng Xie and Qile He and Youjia Zhu and Qiwei He and Mengtian Li},
journal= {arXiv preprint arXiv:2503.08147},
year = {2025}
}
备注
Project page: https://apple-jun.github.io/FilmComposer.github.io/