使用增强数据集的 LLM 生成符号化音乐
声音
2025-06-17 v3 音频与语音处理
摘要
近年来,许多基于大量文本-音频对训练的音频域文本到音乐生成模型涌现出来。然而,符号化可控音乐生成进步滞后于此,部分原因是缺乏包含大量元数据和标题的大规模符号化音乐数据集。本文我们提出 MetaScore,一个新数据集,包含 963K 组音乐记谱与丰富的元数据,包括用户在线音乐论坛上标注的自由形式标签。为实现文本到音乐生成,我们采用预训练的大语言模型 (LLM) 为音乐生成伪自然语言标题。通过增强的 MetaScore,我们训练了一个文本条件音乐生成模型,学习从伪标题生成符号化音乐,允许控制乐器、风格、作曲家、复杂度及其他自由形式音乐描述符。此外,我们训练了一个标签条件系统,支持 MetaScore 中可用的预定义标签集合。我们的实验结果表明,所提出的文本到音乐和标签到音乐模型均在听觉测试中优于基线文本到音乐模型。虽然同时出现 Text2MIDI 也支持自由形式文本输入,但我们的模型实现了相当水平。此外,文本到音乐系统比标签到音乐模型提供更自然的界面,因为它允许用户提供自由形式的自然语言提示。
引用
@article{arxiv.2410.02084,
title = {Generating Symbolic Music from Natural Language Prompts using an LLM-Enhanced Dataset},
author = {Weihan Xu and Julian McAuley and Taylor Berg-Kirkpatrick and Shlomo Dubnov and Hao-Wen Dong},
journal= {arXiv preprint arXiv:2410.02084},
year = {2025}
}
备注
Accepted at ISMIR 2025