基于语言模型预训练的钢琴乐谱图像作曲家风格分类
计算机视觉与模式识别
2020-07-30 v1 计算与语言
机器学习
摘要
本文研究钢琴乐谱图像的作曲家风格分类。以往针对作曲家分类任务的方法受限于数据稀缺。我们从两方面解决该问题:(1) 我们将问题重新设定为基于原始乐谱图像而非符号化音乐格式;(2) 我们提出了一种可在无标签数据上训练的方法。我们的方法首先基于 bootleg 特征表示将乐谱图像转换为音乐“词”的序列,然后将该序列输入文本分类器。我们表明,通过先在一组无标签数据上训练语言模型,使用预训练语言模型的权重初始化分类器,再在少量有标签数据上微调分类器,可以显著提升分类器性能。我们在 IMSLP 中的所有钢琴乐谱图像上训练了 AWD-LSTM、GPT-2 和 RoBERTa 语言模型。我们发现基于 transformer 的架构优于 CNN 和 LSTM 模型,并且预训练将 GPT-2 模型在 9 分类任务上的分类准确率从 46\% 提升至 70\%。训练后的模型也可用作特征提取器,将钢琴乐谱投影到刻画作曲风格的特征空间中。
引用
@article{arxiv.2007.14587,
title = {Composer Style Classification of Piano Sheet Music Images Using Language Model Pretraining},
author = {TJ Tsai and Kevin Ji},
journal= {arXiv preprint arXiv:2007.14587},
year = {2020}
}
备注
8 pages, 7 figures. Accepted paper at the International Society for Music Information Retrieval Conference (ISMIR) 2020