单模、跨模态与多模态视角下的音乐生成综述
声音
2026-03-09 v2 人工智能
多媒体
摘要
多模态音乐生成(music generation)是指利用文本、图像、视频等多种模态信息(包括乐谱和音频)作为指导,进行音乐生成的研究方法,具有广广泛的应用前景。本文对该领域进行综述,按模态视角对音乐生成系统进行分类。综述涵盖模态表示、多模态数据对齐以及其用于指导音乐生成的机制。此外,讨论了当前的数据集和评估方法。该领域的关键挑战包括有效的多模态集成、大规模的综合数据集以及系统化的评估方法。最后,本文提供了对未来研究方向的展望,重点关注创造性、效率、多模态对齐以及评估等方面。
引用
@article{arxiv.2504.00837,
title = {A Survey on Music Generation from Single-Modal, Cross-Modal, and Multi-Modal Perspectives},
author = {Shuyu Li and Shulei Ji and Zihao Wang and Songruoyao Wu and Jiaxing Yu and Kejun Zhang},
journal= {arXiv preprint arXiv:2504.00837},
year = {2026}
}