VidMuse:基于长短期建模的简单视频到音乐生成框架
计算机视觉与模式识别
2025-05-08 v3 机器学习
多媒体
声音
摘要
本工作系统地研究了仅基于视频的音乐生成。首先,我们提出了一个大规模数据集,包含36万个视频音乐配对,涵盖电影预告片、广告和纪录片等各种音乐类型。进一步,我们提出VidMuse,一个用于生成与视频输入相匹配的音乐的简单框架。VidMuse的亮点在于能够产生与视频在声学和语义上都高度匹配的高保真音乐。通过融合局部和全局视觉线索,VidMuse能够创建与视频内容持续匹配的音乐连贯音轨。通过大量实验,我们证明VidMuse在音频质量、多样性和音视频对齐方面优于现有模型。代码和数据集可在https://vidmuse.github.io/获取。
引用
@article{arxiv.2406.04321,
title = {VidMuse: A Simple Video-to-Music Generation Framework with Long-Short-Term Modeling},
author = {Zeyue Tian and Zhaoyang Liu and Ruibin Yuan and Jiahao Pan and Qifeng Liu and Xu Tan and Qifeng Chen and Wei Xue and Yike Guo},
journal= {arXiv preprint arXiv:2406.04321},
year = {2025}
}
备注
The code and datasets are available at https://github.com/ZeyueT/VidMuse/