GVMGen: 一种具有分层注意力的通用视频到音乐生成模型
声音
2025-04-21 v1 人工智能
多媒体
音频与语音处理
摘要
为视频配乐至关重要但具有挑战性,因此人们对自动化视频音乐生成的兴趣日益增长。现有方法通常难以实现鲁棒的音乐-视频对应性和生成多样性,这主要是由于特征对齐方法不足和数据集不够。在本研究中,我们提出了通用视频到音乐生成模型(GVMGen),旨在为视频输入生成高度相关的音乐。我们的模型采用分层注意力,在空间和时间维度上提取视频特征并与音乐对齐,确保保留相关特征同时最小化冗余。值得注意的是,我们的方法具有通用性,能够从不同的视频输入生成多风格音乐,即使在零样本场景下也是如此。我们还提出了一个评估模型以及两个新的客观指标,用于评估视频-音乐对齐。此外,我们整理了一个包含多种类型视频-音乐对的大规模数据集。实验结果表明,GVMGen在音乐-视频对应性、生成多样性和应用通用性方面超越了之前的模型。
引用
@article{arxiv.2501.09972,
title = {GVMGen: A General Video-to-Music Generation Model with Hierarchical Attentions},
author = {Heda Zuo and Weitao You and Junxian Wu and Shihong Ren and Pei Chen and Mingxu Zhou and Yujia Lu and Lingyun Sun},
journal= {arXiv preprint arXiv:2501.09972},
year = {2025}
}
备注
Accepted by the 39th AAAI Conference on Artificial Intelligence (AAAI-25)