中文

PKSpell:数据驱动的音高拼写法与调号估计

声音 2021-07-30 v1 音频与语音处理

摘要

我们提出 PKSpell:一种从 MIDI 文件联合估计音高拼写与调号的数据驱动方法。这两个要素对于生成完整的音乐总谱至关重要,并有助于许多音乐信息检索(MIR)任务,如和声分析、段落识别、旋律相似度以及数字音乐库中的检索。我们设计了一个深度循环神经网络模型,仅需各类 MIDI 文件(包括演奏文件)或其他符号编码中易得的信息。我们发布了在 ASAP 数据集上训练的模型。我们的系统可使用这些预训练参数,且易于集成到 MIR 流水线中。我们还提出了一种数据增强流程,有助于在小数据集上重新训练。PKSpell 在一个具有挑战性的数据集上取得了强劲的调号估计性能。最重要的是,该模型在无需重新训练的情况下,于 MuseData 音高拼写数据集上确立了新的最先进(SOTA)性能。

关键词

引用

@article{arxiv.2107.14009,
  title  = {PKSpell: Data-Driven Pitch Spelling and Key Signature Estimation},
  author = {Francesco Foscarin and Nicolas Audebert and Raphaël Fournier-S'Niehotta},
  journal= {arXiv preprint arXiv:2107.14009},
  year   = {2021}
}

备注

International Society for Music Information Retrieval Conference (ISMIR), Nov 2021, Online, India