XMusic: 面向通用可控符号化音乐生成框架
声音
2025-01-16 v1 人工智能
音频与语音处理
摘要
近年来,人工智能生成内容(AIGC)在图像合成和文本生成等领域取得了显著进展,生成的内容已与人类制作的内容相当。然而,AI生成的音乐质量尚未达到此标准,主要由于难以有效控制音乐情感并确保高质量输出。本文提出了一种通用的符号化音乐生成框架XMusic,支持灵活的提示输入(即图像、视频、文本、标签和哼唱),以实现情感可控且高质量的符号化音乐生成。XMusic由两个核心组件构成:XProjector和XComposer。XProjector将各种模态的提示解析为符号化音乐元素(即情感、风格、节奏和音符),以投影空间中的方式生成匹配的音乐。XComposer包含一个生成器和一个选择器。生成器基于我们创新的符号化音乐表示生成可控情感且旋律的音乐,而选择器通过构建涉及质量评估、情感识别和风格识别任务的多任务学习方案来识别高质量的符号化音乐。此外,我们构建了XMIDI,一个包含108,023个带有精确情感和风格标签的MIDI文件的大型符号化音乐数据集。客观和主观评估表明,XMusic显著优于当前最先进的方法,展现出惊人的音乐质量。我们的XMusic已获评为WAIC 2023 Collectibles精选的九项亮点之一。XMusic项目主页为https://xmusic-project.github.io。
引用
@article{arxiv.2501.08809,
title = {XMusic: Towards a Generalized and Controllable Symbolic Music Generation Framework},
author = {Sida Tian and Can Zhang and Wei Yuan and Wei Tan and Wenjie Zhu},
journal= {arXiv preprint arXiv:2501.08809},
year = {2025}
}
备注
accepted by TMM