MIDI-LLM:为文本到 MIDI 音乐生成适配大型语言模型
声音
2025-11-07 v1 计算与语言
多媒体
摘要
我们提出MIDI-LLM,一个用于从自由形式文本提示生成多轨 MIDI 音乐的大型语言模型(LLM)。我们的方法扩展了文本LLM的词汇表以包含MIDI标记,并采用两阶段训练配方赋予文本到MIDI能力。通过保持原始LLM的参数结构,我们可直接利用vLLM库进行加速推理。实验表明,MIDI-LLM在质量、文本控制和推理速度方面均优于最新的Text2midi模型。演示地址:https://midi-llm-demo.vercel.app
引用
@article{arxiv.2511.03942,
title = {MIDI-LLM: Adapting Large Language Models for Text-to-MIDI Music Generation},
author = {Shih-Lun Wu and Yoon Kim and Cheng-Zhi Anna Huang},
journal= {arXiv preprint arXiv:2511.03942},
year = {2025}
}
备注
To appear at NeurIPS 2025 Workshop on AI for Music