中文

钢琴家 Transformer:通过可扩展自监督预训练实现富有表现力的钢琴演奏渲染

声音 2025-12-03 v1 人工智能 多媒体

摘要

现有的表达性音乐演奏渲染方法依赖于小规模标注数据集上的监督学习,这限制了数据volume 和模型规模的扩展,尽管在 vision 和 language 领域已有大量未标注音乐数据可用。为此,我们提出 Pianist Transformer(钢琴家 Transformer),其包含四项关键贡献:1)统一的音乐仪器数字接口(MIDI)数据表示,用于学习音乐结构和表达的共享原则,无需显式注释;2)高效的非对称架构,使可达上下文长度更长且推理速度更快,同时不牺牲渲染质量;3)包含 1000 亿 token 和 1.35 亿参数的自监督预训练管道,解锁了数据和模型规模的优势,以实现表达性演奏渲染;4)达到最先进水平的表现模型,实现了强大的客观指标和人类水平的主观评分。总体而言,Pianist Transformer 为音乐领域的人类化演奏合成树立了可扩展的路径。

关键词

引用

@article{arxiv.2512.02652,
  title  = {Pianist Transformer: Towards Expressive Piano Performance Rendering via Scalable Self-Supervised Pre-Training},
  author = {Hong-Jie You and Jie-Jing Shao and Xiao-Wen Yang and Lin-Han Jia and Lan-Zhe Guo and Yu-Feng Li},
  journal= {arXiv preprint arXiv:2512.02652},
  year   = {2025}
}