MuVi: 基于语义对齐与节奏同步的视频到音乐生成
声音
2024-10-18 v1 计算机视觉与模式识别
多媒体
音频与语音处理
摘要
生成与视频视觉内容相匹配的音乐一直是具有挑战性的任务, 因其需要深入理解视觉语义,并生成与视觉叙事相协调的旋律、节奏和动态。 本文提出了 MuVi 框架, 有效地解决了这些挑战, 以增强音视频内容的内在性和沉浸式体验。 MuVi 通过专门设计的视觉适配器分析视频内容, 提取具有上下文和时间相关性的特征。 这些特征用于生成不仅匹配视频情绪和主题的音乐, 还能匹配其节奏和节拍。 我们还引入了基于音乐短语周期性特性的对比音视频预训练方案, 以确保同步。 此外, 我们展示了基于流匹配的音乐生成器具有零样例学习能力, 可控制生成音乐的风格和类型。 实验结果表明, MuVi 在音频质量和时间同步方面表现出优越性能。 生成的音乐视频样本可在 https://muvi-v2m.github.io 查看。
引用
@article{arxiv.2410.12957,
title = {MuVi: Video-to-Music Generation with Semantic Alignment and Rhythmic Synchronization},
author = {Ruiqi Li and Siqi Zheng and Xize Cheng and Ziang Zhang and Shengpeng Ji and Zhou Zhao},
journal= {arXiv preprint arXiv:2410.12957},
year = {2024}
}
备注
Working in progress