用于更好理解符号音乐的 N-Gram 无监督复合与特征注入
声音
2023-12-18 v2 人工智能
多媒体
音频与语音处理
摘要
应用深度学习技术进行符号音乐理解的第一步,是将音乐片段(主要为 MIDI 格式)转换为预定义 token 的序列,如音符音高、音符力度和和弦。随后,这些序列被输入到神经序列模型中以完成特定任务。音乐序列在相邻元素之间表现出强相关性,使其成为自然语言处理(NLP)中 N-gram 技术的理想候选。以古典钢琴音乐为例:特定旋律可能在一首乐曲中反复出现,且每次都有细微变化。在本文中,我们提出了一种名为 NG-Midiformer 的新方法,利用 N-gram 方法来理解符号音乐序列。我们的方法首先将音乐片段通过我们提出的无监督复合处理为类词序列,随后使用我们的 N-gram Transformer 编码器,该编码器能有效融入 N-gram 信息以增强主编码器部分,从而更好地理解音乐序列。在大规模音乐数据集上的预训练过程使模型能够充分学习音乐序列中包含的 N-gram 信息,并在微调阶段应用这些信息进行推断。在各种数据集上的实验证明了我们方法的有效性,并在一系列音乐理解下游任务上取得了 SOTA 的性能。代码和模型权重将发布于 https://github.com/CinqueOrigin/NG-Midiformer。
引用
@article{arxiv.2312.08931,
title = {N-Gram Unsupervised Compoundation and Feature Injection for Better Symbolic Music Understanding},
author = {Jinhao Tian and Zuchao Li and Jiajia Li and Ping Wang},
journal= {arXiv preprint arXiv:2312.08931},
year = {2023}
}
备注
8 pages, 2 figures, aaai2024