视觉到音乐生成综述
计算机视觉与模式识别
2025-08-06 v1 人工智能
多媒体
声音
音频与语音处理
摘要
视觉到音乐生成,包括视频到音乐和图像到音乐任务,是多模态人工智能的一个重要分支,展现出巨大的应用前景,广泛应用于配乐、短视频创建和舞蹈音乐合成等领域。然而,与文本和图像等模态的快速发展相比,视觉到音乐的研究仍处于初步阶段,主要due于其复杂的内部结构以及难以建模视频中动态关系。现有综述聚焦于通用音乐生成,未全面讨论视觉到音乐。本文系统性地综述了视觉到音乐生成领域的研究进展。我们首先分析了三种输入类型(常规视频、人体动作视频和图像)以及两种输出类型(符号音乐和音频音乐)的技术特征和核心挑战。随后,我们从架构角度总结了现有的视觉到音乐生成方法。提供了常见数据集和评估指标的详细综述。最后,讨论了当前挑战和未来研究的有前景的方向。我们希望我们的综述能够激发视觉到音乐生成以及更广泛的多模态生成领域在学术研究和工业应用中的进一步创新。为跟踪最新工作并促进该领域的进一步创新,我们持续维护一个 GitHub 仓库。
引用
@article{arxiv.2503.21254,
title = {Vision-to-Music Generation: A Survey},
author = {Zhaokai Wang and Chenxi Bao and Le Zhuo and Jingrui Han and Yang Yue and Yihong Tang and Victor Shea-Jay Huang and Yue Liao},
journal= {arXiv preprint arXiv:2503.21254},
year = {2025}
}