中文

MIDI-LLM:为文本到 MIDI 音乐生成适配大型语言模型

声音 2025-11-07 v1 计算与语言 多媒体

摘要

我们提出MIDI-LLM,一个用于从自由形式文本提示生成多轨 MIDI 音乐的大型语言模型(LLM)。我们的方法扩展了文本LLM的词汇表以包含MIDI标记,并采用两阶段训练配方赋予文本到MIDI能力。通过保持原始LLM的参数结构,我们可直接利用vLLM库进行加速推理。实验表明,MIDI-LLM在质量、文本控制和推理速度方面均优于最新的Text2midi模型。演示地址:https://midi-llm-demo.vercel.app

关键词

引用

@article{arxiv.2511.03942,
  title  = {MIDI-LLM: Adapting Large Language Models for Text-to-MIDI Music Generation},
  author = {Shih-Lun Wu and Yoon Kim and Cheng-Zhi Anna Huang},
  journal= {arXiv preprint arXiv:2511.03942},
  year   = {2025}
}

备注

To appear at NeurIPS 2025 Workshop on AI for Music