BMdataset:音乐学精选的 LilyPond 数据集
声音
2026-04-14 v1 计算与语言
信息检索
摘要
符号化音乐研究几乎完全依赖 MIDI 数据集;文本格式的排版工具如 LilyPond 仍未被用于音乐理解。我们提出 BMdataset,这是一个由音乐学家从原始巴洛克手稿中直接转录的 393 份 LilyPond 小品(2646 场)数据集,包含作曲家、音乐形式、演奏乐器及段落属性等元数据。基于该资源,我们引入 LilyBERT(模型权重可在 https://huggingface.co/csc-unipd/lilybert 处获取),这是一种基于 CodeBERT 的编码器,通过扩展 115 个 LilyPond 专用 token 并进行掩码语言模型预训练来适配符号化音乐。对准域外 Mutopia 语料库进行线性探针测试显示,尽管其规模仅约 9000 万 token,但仅用 BMdataset 微调即可超越在完整 PDMX 语料库(约 150 亿 token)上进行连续预训练的结果,用于作曲家和风格分类,证明小规模的专业精选数据集在音乐理解方面可能优于大规模噪声数据。将广泛预训练与领域特定微调相结合可获得最佳效果(作曲家准确率 84.3%)。我们发布数据集、分词器和模型,以为 LilyPond 上的表示学习树立基准。
引用
@article{arxiv.2604.10628,
title = {BMdataset: A Musicologically Curated LilyPond Dataset},
author = {Matteo Spanio and Ilay Guler and Antonio Rodà},
journal= {arXiv preprint arXiv:2604.10628},
year = {2026}
}
备注
Submitted to SMC2026