Transformer生成钢琴音乐:规模、数据与指标的比较研究
声音
2026-01-06 v2 音频与语音处理
摘要
尽管近年来提出了多种变换器用于符号化音乐生成,但关于具体设计选择如何影响生成音乐质量的系统性研究仍较有限。本文系统比较了不同的数据集、模型架构、模型规模和训练策略用于符号化钢琴音乐生成的任务。为支持模型开发与评估,我们检视了一系列定量指标,并分析了它们与通过听觉研究收集的人类判断之间的关联程度。我们最佳性能模型——一个参数量为9.5亿的变换器,基于来自多元化音乐类型的8万个MIDI文件进行训练,生成的输出经图灵式听觉调查常被评定为人类创作的作品。
关键词
引用
@article{arxiv.2511.07268,
title = {Generating Piano Music with Transformers: A Comparative Study of Scale, Data, and Metrics},
author = {Jonathan Lehmkuhl and Ábel Ilyés-Kun and Nico Bremes and Cemhan Kaan Özaltan and Frederik Muthers and Jiayi Yuan},
journal= {arXiv preprint arXiv:2511.07268},
year = {2026}
}
备注
NeurIPS 2025 Workshop on AI for Music