ChatMusician:利用大语言模型内在地理解与生成音乐
声音
2024-02-27 v1 人工智能
计算与语言
机器学习
多媒体
音频与语音处理
摘要
虽然大语言模型 (LLM) 在文本生成方面展现出令人印象深刻的能力,但我们发现其能力尚未推广到音乐这一人类的创造性语言上。我们推出了 ChatMusician,这是一个集成了内在音乐能力的开源 LLM。它基于对文本兼容的音乐表示法 ABC 记谱法进行持续预训练和微调 LLaMA2,并将音乐视为第二语言。ChatMusician 能够使用纯文本分词器理解和生成音乐,无需任何外部多模态神经结构或分词器。有趣的是,赋予音乐能力并未损害语言能力,甚至实现了略高的 MMLU 分数。我们的模型能够根据文本、和弦、旋律、动机、曲式等条件创作结构良好、全长度的音乐,超越了 GPT-4 基线。在我们精心策划的大学级音乐理解基准 MusicTheoryBench 上,ChatMusician 在零样本设置下以显著优势超越了 LLaMA2 和 GPT-3.5。我们的工作表明,LLM 可以成为音乐的优秀压缩器,但仍有许多领域有待攻克。我们在 GitHub 上发布了我们的 40 亿 token 音乐 - 语言语料库 MusicPile、收集的 MusicTheoryBench、代码、模型和演示。
引用
@article{arxiv.2402.16153,
title = {ChatMusician: Understanding and Generating Music Intrinsically with LLM},
author = {Ruibin Yuan and Hanfeng Lin and Yi Wang and Zeyue Tian and Shangda Wu and Tianhao Shen and Ge Zhang and Yuhang Wu and Cong Liu and Ziya Zhou and Ziyang Ma and Liumeng Xue and Ziyu Wang and Qin Liu and Tianyu Zheng and Yizhi Li and Yinghao Ma and Yiming Liang and Xiaowei Chi and Ruibo Liu and Zili Wang and Pengfei Li and Jingcheng Wu and Chenghua Lin and Qifeng Liu and Tao Jiang and Wenhao Huang and Wenhu Chen and Emmanouil Benetos and Jie Fu and Gus Xia and Roger Dannenberg and Wei Xue and Shiyin Kang and Yike Guo},
journal= {arXiv preprint arXiv:2402.16153},
year = {2024}
}
备注
GitHub: https://shanghaicannon.github.io/ChatMusician/