中文

MuPT:一种生成式符号音乐预训练Transformer

声音 2024-11-06 v4 人工智能 音频与语音处理

摘要

在本文中,我们探索了大语言模型(LLMs)在音乐预训练中的应用。虽然MIDI在音乐建模中的普遍使用已得到公认,但我们的发现表明,LLMs本质上与ABC记谱法更兼容,后者更符合其设计和优势,从而增强了模型在音乐创作中的性能。为了解决生成过程中不同轨道小节不对齐的挑战,我们提出开发一种同步多轨道ABC记谱法(SMT-ABC记谱法),旨在保持多个音乐轨道之间的连贯性。我们的贡献包括一系列能够处理多达8192个token的模型,覆盖了我们训练集中90%的符号音乐数据。此外,我们探讨了符号音乐缩放定律(SMS Law)对模型性能的影响。结果表明,这为未来音乐生成研究指明了有希望的方向,并通过我们的开源贡献为社区主导的研究提供了丰富的资源。

关键词

引用

@article{arxiv.2404.06393,
  title  = {MuPT: A Generative Symbolic Music Pretrained Transformer},
  author = {Xingwei Qu and Yuelin Bai and Yinghao Ma and Ziya Zhou and Ka Man Lo and Jiaheng Liu and Ruibin Yuan and Lejun Min and Xueling Liu and Tianyu Zhang and Xinrun Du and Shuyue Guo and Yiming Liang and Yizhi Li and Shangda Wu and Junting Zhou and Tianyu Zheng and Ziyang Ma and Fengze Han and Wei Xue and Gus Xia and Emmanouil Benetos and Xiang Yue and Chenghua Lin and Xu Tan and Stephen W. Huang and Jie Fu and Ge Zhang},
  journal= {arXiv preprint arXiv:2404.06393},
  year   = {2024}
}