PBSCR:钢琴盗版乐谱作曲家识别数据集
声音
2024-08-07 v3 机器学习
音频与语音处理
摘要
本文阐述、描述并呈现了用于研究古典钢琴音乐作曲家识别的PBSCR数据集。我们的目标是设计一个便于大规模作曲家识别研究的数据集,该数据集适用于现代架构和训练实践。为实现这一目标,我们利用了IMSLP上丰富的乐谱图像和元数据,使用了一种先前提出的称为盗版乐谱的特征表示来编码符头相对于谱线的位置,并以极其简单的格式(二维二值图像)呈现数据,以鼓励快速探索和迭代。该数据集本身包含用于9类识别任务的40,000张62x64盗版乐谱图像,用于100类识别任务的100,000张62x64盗版乐谱图像,以及用于预训练的29,310张未标记的可变长度盗版乐谱图像。标记数据以镜像MNIST图像的形式呈现,以便于以高效的方式进行可视化、操作和模型训练。我们包含了相关信息,将每张盗版乐谱图像与其底层的原始乐谱图像联系起来,并且我们抓取、整理并编译了IMSLP上所有钢琴作品的元数据,以促进多模态研究,并允许方便地链接到其他数据集。我们发布了监督和少样本设置下的基线结果,供未来工作进行比较,并讨论了PBSCR数据特别适合促进研究的开放性问题。
引用
@article{arxiv.2401.16803,
title = {PBSCR: The Piano Bootleg Score Composer Recognition Dataset},
author = {Arhan Jain and Alec Bunn and Austin Pham and TJ Tsai},
journal= {arXiv preprint arXiv:2401.16803},
year = {2024}
}
备注
19 pages, 6 figures, to be published in Transactions of the International Society for Music Information Retrieval