中文

序列音乐生成任务中不同音高与节拍网格编码方法的对比分析

声音 2023-02-01 v1 人工智能 机器学习 音频与语音处理

摘要

音高与节拍是基于符号的音乐生成任务的两个基本音乐特征,研究者通常根据特定目标选择不同编码方法。然而,不同编码方法的优劣鲜有讨论。本文对基于 token 的序列音乐生成模型中两个底层特征(音高与节拍)的影响进行了综合分析。首先,比较了常用的 MIDI 数字编码与较少使用的类-八度编码。其次,将稠密的小节内节拍网格作为辅助特征施加于编码序列。比较了不同复杂度与分辨率的节拍网格。对于复杂度,比较了单 token 方法与多 token 方法;对于网格分辨率,比较了 0(消融)、1(小节级)、4(强拍级)、12(八分三连音级)直至 64(六十四分音符网格级);对于时值分辨率,比较了每拍 4、8、12 和 16 细分。所有不同编码在分别训练的 Transformer-XL 模型上针对旋律生成任务进行测试。就若干客观评价指标对测试集的分布相似性而言,结果表明类-八度编码在音高相关指标上显著优于想当然的 MIDI 编码;更细网格与多 token 网格改善了节奏质量,但在训练早期也出现过拟合。结果从音高嵌入空间与单 token 网格编码的测试损失两方面展示了过拟合的普遍现象。从实践角度,我们既证明了使用更小网络与更低嵌入维度的可行性,也提出了该生成任务易过拟合问题的担忧。发现亦有助于未来模型的特征工程。

关键词

引用

@article{arxiv.2301.13383,
  title  = {An Comparative Analysis of Different Pitch and Metrical Grid Encoding Methods in the Task of Sequential Music Generation},
  author = {Yuqiang Li and Shengchen Li and George Fazekas},
  journal= {arXiv preprint arXiv:2301.13383},
  year   = {2023}
}

备注

This is a draft before submitted to TISMIR as a journal paper