中文

Moonbeam:基于绝对和相对音乐属性的 MIDI 基础模型

声音 2025-05-22 v1 人工智能 音频与语音处理

摘要

Moonbeam 是一个基于 transformer 的符号音乐基础模型,预训练于总计 81.6K 小时、包含 180 亿个 token 的大规模多样化 MIDI 数据集合。Moonbeam 通过引入一种新颖的数据知识驱动的 tokenization 方法和多维相对注意力(MRA),捕捉绝对和相对音乐属性,为模型注入了音乐领域的归纳偏置。利用预训练的 Moonbeam,我们提出了 2 种具备完全前瞻能力的 fine-tuning 架构,针对下游任务类别:符号音乐理解和条件音乐生成(包括音乐填充)。在 4 个数据集上的 3 个下游音乐分类任务中,我们的方法在大多数情况下在准确率和 F1 分数方面均优于其他大规模预训练音乐模型。此外,我们的 fine-tuning 条件音乐生成模型在 REMI 类 tokenizer 的强大 transformer 基线上表现更优。我们在 Github 上开源代码、预训练模型以及生成的样本。

关键词

引用

@article{arxiv.2505.15559,
  title  = {Moonbeam: A MIDI Foundation Model Using Both Absolute and Relative Music Attributes},
  author = {Zixun Guo and Simon Dixon},
  journal= {arXiv preprint arXiv:2505.15559},
  year   = {2025}
}