中文

Museformer:具有细粒度与粗粒度注意力的音乐生成 Transformer

声音 2022-11-01 v2 人工智能 计算与语言 机器学习 多媒体 音频与语音处理

摘要

符号音乐生成旨在自动生成乐谱。近期趋势是在音乐生成中使用 Transformer 或其变体,然而这并非最优,因为全注意力无法高效建模通常很长的音乐序列(例如超过 10,000 个 token),且现有模型在生成音乐重复结构方面存在不足。本文提出 Museformer,一种具有新颖的细粒度与粗粒度注意力的音乐生成 Transformer。具体而言,通过细粒度注意力,某一小节的 token 直接关注与音乐结构最相关的那些小节的所有 token(例如通过相似性统计选取的前第 1、2、4、8 小节);通过粗粒度注意力,一个 token 仅关注其他小节的摘要而非其中每个 token,以降低计算成本。其优势有两点:首先,它可通过细粒度注意力捕捉与音乐结构相关的关联,并通过粗粒度注意力捕捉其他上下文信息;其次,它高效,相比全注意力对应模型可建模超过 3 倍的更长音乐序列。客观与主观实验结果均表明其能够生成具有高质量和更好结构的长音乐序列。

关键词

引用

@article{arxiv.2210.10349,
  title  = {Museformer: Transformer with Fine- and Coarse-Grained Attention for Music Generation},
  author = {Botao Yu and Peiling Lu and Rui Wang and Wei Hu and Xu Tan and Wei Ye and Shikun Zhang and Tao Qin and Tie-Yan Liu},
  journal= {arXiv preprint arXiv:2210.10349},
  year   = {2022}
}

备注

Accepted by the Thirty-sixth Conference on Neural Information Processing Systems (NeurIPS 2022)