MuseMorphose:基于单一 Transformer VAE 的整曲细粒度钢琴音乐风格迁移
声音
2022-12-21 v3 机器学习
多媒体
音频与语音处理
摘要
Transformer 与变分自编码器(VAE)已被广泛用于符号化(如 MIDI)领域的音乐生成。前者在建模长序列方面具有令人印象深刻的能力,而后者允许用户主动控制待生成音乐的不同部分(如小节)。本文致力于将二者结合,构建兼具这两种优势的单模型。该任务被拆分为两步。首先,我们使 Transformer 解码器在序列生成过程中能够接受片段级、时变的条件。随后,我们将所开发并经过测试的带注意力解码器与 Transformer 编码器结合,并以 VAE 目标训练所得的 MuseMorphose 模型,以实现长篇幅流行钢琴曲的风格迁移,其中用户可指定包括节奏强度与复调性(即和声丰满度)在内的音乐属性,且可细化到小节级别。实验表明,在风格迁移任务中众多广泛使用的指标上,MuseMorphose 优于基于循环神经网络(RNN)的基线方法。
引用
@article{arxiv.2105.04090,
title = {MuseMorphose: Full-Song and Fine-Grained Piano Music Style Transfer with One Transformer VAE},
author = {Shih-Lun Wu and Yi-Hsuan Yang},
journal= {arXiv preprint arXiv:2105.04090},
year = {2022}
}
备注
Accepted for Publication at IEEE/ACM Transactions on Audio, Speech, and Language Processing (TASLP). Online supplemental materials are attached to the end of this arXiv version