MuseCoco:从文本生成符号音乐
声音
2023-06-02 v1 人工智能
计算与语言
机器学习
多媒体
音频与语音处理
摘要
从文本描述生成音乐是一种用户友好的模式,因为文本是用户参与相对容易的接口。尽管一些方法利用文本来控制音乐音频生成,但用户在生成音频中编辑音乐元素颇具挑战。相比之下,符号音乐易于编辑,使用户能更便捷地操控特定音乐元素。本文中,我们提出 MuseCoco,其以音乐属性为桥梁将任务拆解为文本到属性理解和属性到音乐生成两个阶段,从而从文本描述生成符号音乐。MuseCoco 意为音乐创作副驾驶,使音乐家能根据给定文本描述直接生成音乐,相较完全从零创作效率显著提升。该系统有两个主要优势:首先,它数据高效。在属性到音乐生成阶段,属性可直接从音乐序列提取,使模型训练为自监督。在文本到属性理解阶段,文本由 ChatGPT 基于定义的属性模板合成与精炼。其次,系统可通过文本描述中的特定属性实现精确控制,并经由属性条件化或文本条件化方法提供多种控制选项。MuseCoco 在音乐性、可控性和总分上分别至少以 1.27、1.08 和 1.32 优于基线系统。此外,客观控制精度约有 20% 的显著提升。我们还开发了一个具有 12 亿参数的鲁棒大规模模型,展现出卓越的可控性与音乐性。
引用
@article{arxiv.2306.00110,
title = {MuseCoco: Generating Symbolic Music from Text},
author = {Peiling Lu and Xin Xu and Chenfei Kang and Botao Yu and Chengyi Xing and Xu Tan and Jiang Bian},
journal= {arXiv preprint arXiv:2306.00110},
year = {2023}
}