中文

Diff-BGM:用于视频背景音乐生成的扩散模型

计算机视觉与模式识别 2024-05-21 v1

摘要

在编辑视频时,吸引人的背景音乐是必不可少的。然而,视频背景音乐生成任务面临若干挑战,例如缺乏合适的训练数据集,以及难以灵活控制音乐生成过程并依次对齐视频与音乐。本文首先提出了包含详细标注和镜头检测的高质量音乐视频数据集 BGM909,以提供关于视频与音乐的多模态信息。随后,我们提出评估指标以衡量音乐质量,包括音乐多样性和音乐与视频之间的对齐度(使用检索精度指标)。最后,我们提出 Diff-BGM 框架用于自动为给定视频生成背景音乐,该框架利用不同信号控制生成过程中的不同方面,即使用动态视频特征控制音乐节奏,使用语义特征控制旋律和氛围。我们通过引入分段感知跨注意力层来实现视频与音乐的顺序对齐。实验验证了所提方法的有效性。代码和模型已提供于 https://github.com/sizhelee/Diff-BGM。

关键词

引用

@article{arxiv.2405.11913,
  title  = {Diff-BGM: A Diffusion Model for Video Background Music Generation},
  author = {Sizhe Li and Yiming Qin and Minghang Zheng and Xin Jin and Yang Liu},
  journal= {arXiv preprint arXiv:2405.11913},
  year   = {2024}
}

备注

Accepted by CVPR 2024(Poster)