MusicBERT:基于大规模预训练的符号音乐理解模型
声音
2021-06-11 v1 计算与语言
信息检索
多媒体
音频与语音处理
摘要
符号音乐理解是指从符号数据(例如MIDI格式而非音频)理解音乐,涵盖诸多音乐应用,如流派分类、情感分类和乐曲匹配。尽管良好的音乐表示有益于这些应用,但训练数据的缺乏阻碍了表示学习。受自然语言处理中预训练模型成功的启发,本文开发了MusicBERT,一个用于音乐理解的大规模预训练模型。为此,我们构建了一个包含超过100万首乐曲的大规模符号音乐语料库。由于符号音乐包含更多的结构性(如小节、位置)和多样性信息(如速度、乐器、音高),直接将NLP中的预训练技术套用于符号音乐仅带来微小收益。因此,我们设计了若干机制,包括OctupleMIDI编码与小节级掩码策略,以增强基于符号音乐数据的预训练。实验证明了MusicBERT在四项音乐理解任务上的优势,包括旋律补全、伴奏建议、流派分类与风格分类。消融研究也验证了我们所设计的OctupleMIDI编码与小节级掩码策略在MusicBERT中的有效性。
引用
@article{arxiv.2106.05630,
title = {MusicBERT: Symbolic Music Understanding with Large-Scale Pre-Training},
author = {Mingliang Zeng and Xu Tan and Rui Wang and Zeqian Ju and Tao Qin and Tie-Yan Liu},
journal= {arXiv preprint arXiv:2106.05630},
year = {2021}
}
备注
Accepted by ACL 2021 Findings