中文

基于 Transformer 的节拍注释的性能 MIDI 节奏量化

声音 2026-04-27 v1 多媒体 音频与语音处理

摘要

节奏转录是符号级自动音乐转录(AMT)中的关键子任务。虽然深度学习模型已广泛用于检测音频和 MIDI 性能中的度数格子,但节拍驱动的节奏量化仍 largely 未被探索。本文引入一种新颖的深度学习方法,用于基于先验节拍信息对 MIDI 性能进行量化。我们的方法利用 Transformer 架构有效地处理同步的乐谱和演奏数据,以训练量化模型。我们方法的关键组件包括数据集准备、一种基于节拍的预量化方法以在统一框架内对齐演奏与乐谱时间,以及针对该任务的 MIDI 标记器。我们基于 T5 架构调整 Transformer 模型,以满足节奏量化的特定要求。该模型使用一组针对量化性能客观评估设计的得分级别指标进行评估。通过系统化评估,我们优化了数据表示和模型架构。此外,我们应用了性能和乐谱增强技术,如转位、音符删除和演奏侧时间抖动,以增强模型的鲁棒性。最后,对定性分析将我们的模型在 various example pieces 上的量化性能与基于概率方法和深度学习模型的最先进水平进行比较。我们的模型在 ASAP 数据集上实现了 97.3% 的 onset F1 分数和 83.3% 的音符值准确率。它在各种时间签名上都能很好地泛化,包括训练期间未见过的时间签名,并且产生可读的乐谱输出。对仪器特定数据集进行微调可进一步提升性能,通过捕获特定的节奏和旋律模式。本工作为基于 Transformer 的节拍 MIDI 量化提供了一个稳健且灵活的框架。

关键词

引用

@article{arxiv.2604.22290,
  title  = {Transformer-Based Rhythm Quantization of Performance MIDI Using Beat Annotations},
  author = {Maximilian Wachter and Sebastian Murgul and Michael Heizmann},
  journal= {arXiv preprint arXiv:2604.22290},
  year   = {2026}
}

备注

Accepted to the 5th International Conference on SMART MULTIMEDIA (ICSM), 2025