中文

利用公共领域电影集合进行视频引导的文本到音乐生成

声音 2025-07-01 v3 多媒体 音频与语音处理

摘要

尽管音乐生成系统近期取得了进展,但它们在电影制作中的应用仍然有限,因为它们难以捕捉真实电影制作的细微之处——电影制作人在为场景选择或创作音乐时会考虑视觉内容、对话和情感基调等多重因素。这一限制主要源于缺乏整合这些元素的综合性数据集。为填补这一空白,我们引入了开放银幕配乐库(OSSL),一个由公共领域电影片段组成的数据集,总计约 36.5 小时,配有高质量配乐和人类标注的情感信息。为展示我们的数据集在提升预训练模型电影配乐生成任务性能方面的有效性,我们引入了一种新的视频适配器,通过添加基于视频的条件增强来提升自回归 Transformer 基础的文本到音乐模型。实验结果表明,我们提出的方法在分布和配对保真度的客观指标以及情感和类型的兼容性主观指标方面均有效增强了 MusicGen-Medium。为促进可复现性和推动未来工作,我们公开发布了数据集、代码和演示。

关键词

引用

@article{arxiv.2506.12573,
  title  = {Video-Guided Text-to-Music Generation Using Public Domain Movie Collections},
  author = {Haven Kim and Zachary Novack and Weihan Xu and Julian McAuley and Hao-Wen Dong},
  journal= {arXiv preprint arXiv:2506.12573},
  year   = {2025}
}

备注

ISMIR 2025 regular paper. Dataset, code, and demo available at https://havenpersona.github.io/ossl-v1