中文

符号钢琴演奏自监督表征学习的规模化

声音 2025-07-01 v1 人工智能 机器学习 音频与语音处理

摘要

我们研究了在大量符号钢琴独奏谱本上进行预训练的生成式自回归变压器模型能力。首先在约60,000小时的音乐数据上进行预训练,然后使用较小的高质量子集进行微调,以产生音乐延续、执行符号分类任务,以及通过适应 SimCLR 框架生成通用对比 MIDI 嵌入。当评估钢琴延续的连贯性时,我们的生成模型在领先的符号生成技术中表现优于,并与专有的音频生成模型保持竞争力。在 MIR 分类基准测试中,我们的对比模型的冻结表征在线性探针实验中实现了最先进的结果,而直接微调则显示了预训练表征的通用性,通常只需少量标注样本即可针对下游任务进行专业化。

关键词

引用

@article{arxiv.2506.23869,
  title  = {Scaling Self-Supervised Representation Learning for Symbolic Piano Performance},
  author = {Louis Bradshaw and Honglu Fan and Alexander Spangher and Stella Biderman and Simon Colton},
  journal= {arXiv preprint arXiv:2506.23869},
  year   = {2025}
}

备注

ISMIR (2025)