M6(GPT)3:基于遗传算法、概率方法和GPT模型的文本到MIDI多轨可修改音乐生成
声音
2025-09-30 v3 人机交互
音频与语音处理
摘要
本工作介绍了M6(GPT)3作曲系统,能够从自然语言输入描述生成任何时间签名下的完整多分钟 musical composition。系统利用自回归变压器语言模型将自然语言提示映射到JSON格式的作曲参数。所定义的结构包括时间签名、调性、和弦进行以及valence-arousal值,从而生成伴奏、旋律、贝斯、动机和打击乐轨道。我们提出了一种用于生成旋律元素的遗传算法。该算法包含具有音乐意义的变异以及基于正态分布和预定义音乐特征值的适应度函数。这些值受情感参数和不同演奏风格的影响而自适应演化。用于生成任何时间签名下打击乐的系统采用概率方法,包括马尔可夫链。通过人类和客观评估,我们展示了该音乐生成方法在特定有意义的音乐指标上优于基线,为纯神经网络系统提供了可行的替代方案。
引用
@article{arxiv.2409.12638,
title = {M6(GPT)3: Generating Multitrack Modifiable Multi-Minute MIDI Music from Text using Genetic algorithms, Probabilistic methods and GPT Models in any Progression and Time Signature},
author = {Jakub Poćwiardowski and Mateusz Modrzejewski and Marek S. Tatara},
journal= {arXiv preprint arXiv:2409.12638},
year = {2025}
}
备注
Published in 2025 IEEE International Conference on Multimedia and Expo Workshops (ICMEW)