NotaGen:通过大型语言模型训练范式推进符号音乐生成中的音乐性
声音
2025-03-24 v5 人工智能
音频与语音处理
摘要
我们介绍了NotaGen,一种旨在探索生成高质量古典乐谱潜力的符号音乐生成模型。受大型语言模型(LLM)成功的启发,NotaGen采用了预训练、微调和强化学习范式(以下称为LLM训练范式)。它在ABC记谱法的160万首音乐作品上进行预训练,然后在约9000首高质量古典作品上进行微调,条件为'时期-作曲家-配器'提示。对于强化学习,我们提出了CLaMP-DPO方法,进一步提升了生成质量和可控性,无需人工标注或预定义奖励。我们的实验证明了CLaMP-DPO在不同架构和编码方案的符号音乐生成模型中的有效性。此外,主观A/B测试表明NotaGen在符号音乐生成中优于基线模型和人类作品,极大地推进了符号音乐生成中的音乐美学。
引用
@article{arxiv.2502.18008,
title = {NotaGen: Advancing Musicality in Symbolic Music Generation with Large Language Model Training Paradigms},
author = {Yashan Wang and Shangda Wu and Jianhuai Hu and Xingjian Du and Yueqi Peng and Yongxin Huang and Shuai Fan and Xiaobing Li and Feng Yu and Maosong Sun},
journal= {arXiv preprint arXiv:2502.18008},
year = {2025}
}