中文

基于掩码语言模型的 MIDI 到吉他选项卡推断

声音 2024-08-12 v1 计算与语言 信息检索

摘要

吉他选项卡通过将每个音符分配到吉他在特定调音下的字符串和品位,丰富了传统音乐记谱的结构,精确指示在乐器上演奏音符的确切位置。从符号音乐表示生成选项卡的问题涉及整个作品或演奏中对该字符串和品位分配的推断。在吉他上,大多数音高可能存在多个字符串-品位分配,这导致大量组合空间,阻止穷举搜索方法。大多数现代方法使用基于约束的动态规划来最小化某些成本函数(例如手部位置移动)。本文引入了一种新型深度学习解决方案用于符号吉他选项卡估计。我们以掩码语言模型范式训练一个编码器-解码器 Transformer 模型以为音符分配字符串。该模型首先在拥有超过 25K 份选项卡的数据集 DadaGP 上进行预训练,然后在精选的专业转录吉他演奏集上进行微调。鉴于评估选项卡质量的主观性,我们对吉他手进行用户研究,要求他们对同一四小节片段的多个选项卡版本进行可玩性评分。结果表明,我们的系统在与竞争算法相比,显著优于它们。

关键词

引用

@article{arxiv.2408.05024,
  title  = {MIDI-to-Tab: Guitar Tablature Inference via Masked Language Modeling},
  author = {Drew Edwards and Xavier Riley and Pedro Sarmento and Simon Dixon},
  journal= {arXiv preprint arXiv:2408.05024},
  year   = {2024}
}

备注

Reviewed pre-print accepted for publication at ISMIR 2024