中文

PerTok:符号音乐想法与变体的表达编码与建模

声音 2024-10-04 v1 机器学习 音频与语音处理

摘要

我们提出 Cadenza,一个新的多阶段生成框架,用于预测符号音乐想法的表达变体以及无条件生成。为此,我们提出一种新型的 MIDI 编码方法 PerTok(Performance Tokenizer),在捕捉微妙表达细节方面,同时将序列长度缩短最高可达 59%,词汇表大小缩短最高可达 95%,适用于多音轨、单音轨和节奏任务。该框架由两个顺序阶段组成:1)作曲家和2)演奏家。作曲家模型是基于 Transformer 的变分自编码器(VAE),采用旋转位置嵌入(RoPE)和修改的自回归解码器,以更有效地整合输入音乐想法的潜在代码。演奏家模型是一个双向 Transformer 编码器,专门用于预测 MIDI 序列的力度和微时间。客观和人类评估表明,Cadenza 在音乐质量上与其他无条件最先进符号模型相当,同时更具表现力;并且能够创作出既与输入风格相关又为用户提供新颖想法的新作品。该框架旨在为音乐家提供伦理的灵感。

关键词

引用

@article{arxiv.2410.02060,
  title  = {PerTok: Expressive Encoding and Modeling of Symbolic Musical Ideas and Variations},
  author = {Julian Lenz and Anirudh Mani},
  journal= {arXiv preprint arXiv:2410.02060},
  year   = {2024}
}