中文

ComposerX:基于大语言模型的多智能体符号音乐创作

声音 2024-05-01 v2 人工智能 计算与语言 机器学习 多媒体 音频与语音处理

摘要

音乐创作代表了人类创造性的一面,其本身是一项复杂任务,需要理解并生成具有长依赖性和和声约束的信息。尽管当前大语言模型(LLM)在STEM学科中展现出令人印象深刻的能力,但在此任务中即使配备了上下文学习和思维链等现代技术,也容易失败,生成拙劣的音乐作品。为了进一步探索和增强LLM在音乐创作中的潜力,利用其推理能力以及音乐史和理论中的庞大知识库,我们提出了ComposerX,一个基于智能体的符号音乐生成框架。我们发现,采用多智能体方法显著提升了GPT-4的音乐创作质量。结果表明,ComposerX能够生成连贯的多声部音乐作品,旋律引人入胜,同时遵循用户指令。

关键词

引用

@article{arxiv.2404.18081,
  title  = {ComposerX: Multi-Agent Symbolic Music Composition with LLMs},
  author = {Qixin Deng and Qikai Yang and Ruibin Yuan and Yipeng Huang and Yi Wang and Xubo Liu and Zeyue Tian and Jiahao Pan and Ge Zhang and Hanfeng Lin and Yizhi Li and Yinghao Ma and Jie Fu and Chenghua Lin and Emmanouil Benetos and Wenwu Wang and Guangyu Xia and Wei Xue and Yike Guo},
  journal= {arXiv preprint arXiv:2404.18081},
  year   = {2024}
}