Text2midi:从文本描述生成符号音乐
声音
2025-06-18 v2 人工智能
计算与语言
音频与语音处理
摘要
本文介绍了 text2midi,这是一个将文本描述生成 MIDI 文件的端到端模型。借助多模态生成方法日益流行的趋势,text2midi 利用海量文本数据的可获得性以及大型语言模型(LLM)的成功。我们的端到端系统利用 LLM 的强大功能以 MIDI 文件形式生成符号音乐。具体而言,我们使用预训练的 LLM 编码器处理文本描述,然后条件化一个自回归变压器解码器,以产生准确反映所提供描述的 MIDI 序列。这种直观且用户友好的方法显著简化了音乐创作过程,使用户能够通过文本提示生成音乐作品。我们进行了综合的实证评估,包括自动化和人类研究,结果表明该模型生成的 MIDI 文件质量高且可由包含和弦、调性和节拍等音乐理论术语的文本描述控制。我们将代码和音乐样本发布在演示页面(https://github.com/AMAAI-Lab/Text2midi)供用户与 text2midi 互动。
引用
@article{arxiv.2412.16526,
title = {Text2midi: Generating Symbolic Music from Captions},
author = {Keshav Bhandari and Abhinaba Roy and Kyra Wang and Geeta Puri and Simon Colton and Dorien Herremans},
journal= {arXiv preprint arXiv:2412.16526},
year = {2025}
}
备注
9 pages, 3 figures, Accepted at the 39th AAAI Conference on Artificial Intelligence (AAAI 2025)