中文

MIDI-GPT:面向计算机辅助多轨音乐作曲的可控生成模型

声音 2025-02-05 v2 机器学习 多媒体 音频与语音处理

摘要

我们提出并公开了 MIDI-GPT,这是一个基于 Transformer 架构的生成系统,旨在支持计算机辅助音乐作曲工作流程。MIDI-GPT 支持在轨道和小节级别进行音乐材料的填充(infilling),并且可以基于包括仪器类型、音乐风格、音符密度、多音性水平和音符时长在生成过程中进行条件化。为整合这些功能,我们采用了另一种表示方法,将每个轨道的时间有序音乐事件序列拼接成单个序列,而不是使用单一的时间有序序列将不同轨道的音乐事件交错排列。我们还提出了一种允许表达性的表示变体。我们 presenting 的实验结果表明,MIDI-GPT 能够始终避免复制其训练材料中重复的音乐内容,生成的音乐风格与训练数据集相似,并且属性控制允许对生成材料施加各种约束。我们还概述了 MIDI-GPT 的几个实际应用,包括与行业合作伙伴合作,探索将 MIDI-GPT 集成到商业产品中并进行评估,以及使用它生产的几个艺术作品。

关键词

引用

@article{arxiv.2501.17011,
  title  = {MIDI-GPT: A Controllable Generative Model for Computer-Assisted Multitrack Music Composition},
  author = {Philippe Pasquier and Jeff Ens and Nathan Fradet and Paul Triana and Davide Rizzotti and Jean-Baptiste Rolland and Maryam Safi},
  journal= {arXiv preprint arXiv:2501.17011},
  year   = {2025}
}

备注

AAAI 25