PKSpell:数据驱动的音高拼写法与调号估计
声音
2021-07-30 v1 音频与语音处理
摘要
我们提出 PKSpell:一种从 MIDI 文件联合估计音高拼写与调号的数据驱动方法。这两个要素对于生成完整的音乐总谱至关重要,并有助于许多音乐信息检索(MIR)任务,如和声分析、段落识别、旋律相似度以及数字音乐库中的检索。我们设计了一个深度循环神经网络模型,仅需各类 MIDI 文件(包括演奏文件)或其他符号编码中易得的信息。我们发布了在 ASAP 数据集上训练的模型。我们的系统可使用这些预训练参数,且易于集成到 MIR 流水线中。我们还提出了一种数据增强流程,有助于在小数据集上重新训练。PKSpell 在一个具有挑战性的数据集上取得了强劲的调号估计性能。最重要的是,该模型在无需重新训练的情况下,于 MuseData 音高拼写数据集上确立了新的最先进(SOTA)性能。
引用
@article{arxiv.2107.14009,
title = {PKSpell: Data-Driven Pitch Spelling and Key Signature Estimation},
author = {Francesco Foscarin and Nicolas Audebert and Raphaël Fournier-S'Niehotta},
journal= {arXiv preprint arXiv:2107.14009},
year = {2021}
}
备注
International Society for Music Information Retrieval Conference (ISMIR), Nov 2021, Online, India