MusiConGen:基于 Transformer 的文本到音乐生成中的节奏与和弦控制
声音
2024-07-23 v1 人工智能
音频与语音处理
摘要
现有的文本到音乐模型能够生成高质量的音频并具备很大的多样性。然而,仅凭文本提示无法精确控制生成音乐中诸如和弦和节奏等时间性音乐特征。为此,我们引入了 MusiConGen,一个基于预训练 MusicGen 框架的时序条件 Transformer 文本到音乐模型。我们的创新点在于针对消费级 GPU 设计的高效微调机制,将自动提取的节奏和和弦作为条件信号。推理时,条件信号可以来自参考音频信号中提取的音乐特征,或为用户定义的符号和弦序列、BPM 和文本提示。我们在两个数据集上进行性能评估——一个来自提取特征,另一个来自用户创建的输入——结果表明 MusiConGen 能够生成与指定条件一致的真实背景音轨。我们开源了代码和模型检查点,并在线提供音频示例,https://musicongen.github.io/musicongen_demo/。
引用
@article{arxiv.2407.15060,
title = {MusiConGen: Rhythm and Chord Control for Transformer-Based Text-to-Music Generation},
author = {Yun-Han Lan and Wen-Yi Hsiao and Hao-Chung Cheng and Yi-Hsuan Yang},
journal= {arXiv preprint arXiv:2407.15060},
year = {2024}
}
备注
Accepted by the 25th International Society for Music Information Retrieval (ISMIR)