中文

VMAS:基于语义对齐的网页音乐视频视频到音乐生成

多媒体 2024-09-12 v1 计算机视觉与模式识别 声音 音频与语音处理

摘要

我们提出了一个从视频输入生成背景音乐的框架。不同于依赖符号化音乐标注的现有方法,这些标注在数量和多样性方面有限,我们的方法利用大规模伴随背景音乐的网络视频。这使我们的模型能够学习生成逼真且多样化的音乐。为实现这一目标,我们开发了一种基于语义对齐的生成式视频音乐Transformer。我们的模型使用联合自回归和对比学习目标,鼓励生成与高层次视频内容相匹配的音乐。我们还引入了一种新的视频节拍对齐方案,将生成的音乐节拍与视频中的低层次动作相匹配。最后,为了捕捉视频中用于逼真背景音乐生成的细粒度视觉线索,我们引入了一种新的时序视频编码器架构,使我们能够高效处理由大量密集采样帧组成的视频。我们在新构建的DISCO-MV数据集上训练了该框架,该数据集包含220万个视频音乐样本,数量和规模都远超以往用于视频音乐生成的任何数据集。我们的方法在DISCO-MV和MusicCaps数据集上根据各种音乐生成评估指标(包括人类评估) outperform了现有方法。

关键词

引用

@article{arxiv.2409.07450,
  title  = {VMAS: Video-to-Music Generation via Semantic Alignment in Web Music Videos},
  author = {Yan-Bo Lin and Yu Tian and Linjie Yang and Gedas Bertasius and Heng Wang},
  journal= {arXiv preprint arXiv:2409.07450},
  year   = {2024}
}

备注

Project Page: https://genjib.github.io/project_page/VMAs/index.html