中文

碎片化的力量:用于符号音乐生成中结构分割的分层Transformer模型

声音 2022-07-12 v2 机器学习 音频与语音处理

摘要

符号音乐生成依赖于生成模型的上下文表示能力,其中最普遍的方法是基于Transformer的模型。音乐上下文的学习也与音乐中的结构元素相关,即前奏、主歌和副歌,而这些目前被研究界所忽视。在本文中,我们提出一种分层Transformer模型来学习音乐中的多尺度上下文。在编码阶段,我们首先设计了一个碎片范围定位层,将音乐切分为和弦与乐段。然后,我们使用多尺度注意力机制来学习音符级、和弦级和乐段级的上下文。在解码阶段,我们提出了一种分层Transformer模型,使用细解码器并行生成乐段,并使用粗解码器解码合并后的音乐。我们还设计了一个音乐风格归一化层,以在生成的各乐段之间实现一致的风格。我们的模型在两个公开MIDI数据集上进行了评估,实验表明我们的模型优于最佳的当代音乐生成模型。更令人振奋的是,可视化评估显示我们的模型在旋律复用方面更优,从而生成更逼真的音乐。

关键词

引用

@article{arxiv.2205.08579,
  title  = {The Power of Fragmentation: A Hierarchical Transformer Model for Structural Segmentation in Symbolic Music Generation},
  author = {Guowei Wu and Shipei Liu and Xiaoya Fan},
  journal= {arXiv preprint arXiv:2205.08579},
  year   = {2022}
}