中文

GVMGen: 一种具有分层注意力的通用视频到音乐生成模型

声音 2025-04-21 v1 人工智能 多媒体 音频与语音处理

摘要

为视频配乐至关重要但具有挑战性,因此人们对自动化视频音乐生成的兴趣日益增长。现有方法通常难以实现鲁棒的音乐-视频对应性和生成多样性,这主要是由于特征对齐方法不足和数据集不够。在本研究中,我们提出了通用视频到音乐生成模型(GVMGen),旨在为视频输入生成高度相关的音乐。我们的模型采用分层注意力,在空间和时间维度上提取视频特征并与音乐对齐,确保保留相关特征同时最小化冗余。值得注意的是,我们的方法具有通用性,能够从不同的视频输入生成多风格音乐,即使在零样本场景下也是如此。我们还提出了一个评估模型以及两个新的客观指标,用于评估视频-音乐对齐。此外,我们整理了一个包含多种类型视频-音乐对的大规模数据集。实验结果表明,GVMGen在音乐-视频对应性、生成多样性和应用通用性方面超越了之前的模型。

关键词

引用

@article{arxiv.2501.09972,
  title  = {GVMGen: A General Video-to-Music Generation Model with Hierarchical Attentions},
  author = {Heda Zuo and Weitao You and Junxian Wu and Shihong Ren and Pei Chen and Mingxu Zhou and Yujia Lu and Lingyun Sun},
  journal= {arXiv preprint arXiv:2501.09972},
  year   = {2025}
}

备注

Accepted by the 39th AAAI Conference on Artificial Intelligence (AAAI-25)