VidMusician:基于层次视觉特征实现语义-节奏对齐的视频到音乐生成
声音
2024-12-10 v1 音频与语音处理
摘要
视频到音乐生成在视频制作中具有巨大的潜力,生成的音乐需要在语义和节奏上与视频实现对齐。要实现这一对齐,需具备先进的音乐生成能力、精细的视频理解能力,以及一种高效的机制来学习两种模态之间的对应关系。本文提出了VidMusician,一个基于文本到音乐模型构建的、参数高效的视频到音乐生成框架。VidMusician利用层次视觉特征确保视频与音乐在语义和节奏上的对齐。具体而言,我们的方法将全局视觉特征作为语义条件,将局部视觉特征作为节奏线索。这些特征通过跨注意力和内注意力机制分别集成到生成主干中。通过两阶段训练,我们逐步引入语义和节奏特征,采用零初始化和恒等初始化以保持主干的内在音乐生成能力。此外,我们构建了一个涵盖各种场景(如宣传视频、广告片段和合集)的多样化视频音乐数据集DVMSet。实验表明,VidMusician在多个评估指标上均优于当前最先进的方法,并在AI生成视频上表现出色。样本可见于\url{https://youtu.be/EPOSXwtl1jw}。
引用
@article{arxiv.2412.06296,
title = {VidMusician: Video-to-Music Generation with Semantic-Rhythmic Alignment via Hierarchical Visual Features},
author = {Sifei Li and Binxin Yang and Chunji Yin and Chong Sun and Yuxin Zhang and Weiming Dong and Chen Li},
journal= {arXiv preprint arXiv:2412.06296},
year = {2024}
}