中文

一种用于多乐器符号音乐生成的多尺度注意力 Transformer

声音 2023-05-29 v1 音频与语音处理

摘要

近年来,多乐器音乐生成已成为一个热门话题。与单乐器生成不同,多乐器生成除乐器内连贯性外还需考虑乐器间和声。这通常通过将来自不同乐器的音符片段组合为信号序列来实现。这种组合可处于不同尺度,如音符、小节或音轨。大多数现有工作聚焦于特定尺度,导致在建模具有多样时间与音轨依赖的音乐方面存在不足。本文提出一种多尺度注意力 Transformer 模型以提升多乐器生成的质量。我们首先采用多个 Transformer 解码器学习不同尺度的多乐器表示,然后设计一种注意力机制融合多尺度信息。在 SOD 和 LMD 数据集上进行的实验表明,与基于单尺度信息的模型相比,我们的模型在定量与定性性能上均有提升。源代码与部分生成样本可在 https://github.com/HaRry-qaq/MSAT 获取。

关键词

引用

@article{arxiv.2305.16592,
  title  = {A Multi-Scale Attentive Transformer for Multi-Instrument Symbolic Music Generation},
  author = {Xipin Wei and Junhui Chen and Zirui Zheng and Li Guo and Lantian Li and Dong Wang},
  journal= {arXiv preprint arXiv:2305.16592},
  year   = {2023}
}

备注

to be published in INTERSPEECH 2023