面向视频到音乐生成的生成式AI综合调查
音频与语音处理
2025-12-23 v2 人工智能
多媒体
摘要
视频到音乐生成的快速发展归因于多模态生成模型的兴起。然而,目前缺乏对该领域工作进行全面梳理的文献。为填补这一空白,本文综述了使用深度生成式AI技术进行视频到音乐生成的方法,重点关注三个关键组成部分:条件输入构建、条件机制和音乐生成框架。我们依据各组件的设计进行分类,阐明不同策略的作用。此前,我们对视频和音乐模态进行细粒度分类,说明不同类别如何影响生成管道中各组件的设计。进一步,我们总结了可用的多模态数据集和评估指标,同时突出了该领域的持续挑战。
引用
@article{arxiv.2502.12489,
title = {A Comprehensive Survey on Generative AI for Video-to-Music Generation},
author = {Shulei Ji and Songruoyao Wu and Zihao Wang and Shuyu Li and Kejun Zhang},
journal= {arXiv preprint arXiv:2502.12489},
year = {2025}
}