基于矢量量化离散扩散模型的作曲家风格特定符号音乐生成
声音
2024-09-05 v2 人工智能
音频与语音处理
摘要
新兴的去噪扩散概率模型(DDPM)因在图像与声音合成等连续数据多样生成任务中取得令人瞩目的结果而得到日益广泛的应用。然而,扩散模型的成功尚未完全拓展至离散符号音乐。我们提出结合矢量量化变分自编码器(VQ-VAE)与离散扩散模型,以生成具有期望作曲家风格的符号音乐。训练后的 VQ-VAE 可将符号音乐表示为与所学码本中特定条目相对应的索引序列。随后,使用离散扩散模型对 VQ-VAE 的离散潜空间进行建模。该扩散模型被训练用于生成由码本索引组成的中间音乐序列,再由 VQ-VAE 的解码器解码为符号音乐。评估结果表明,我们的模型能够以 72.36% 的高准确率生成满足给定条件的目标作曲家风格符号音乐。我们的代码见 https://github.com/jinchengzhanggg/VQVAE-Diffusion。
引用
@article{arxiv.2310.14044,
title = {Composer Style-specific Symbolic Music Generation Using Vector Quantized Discrete Diffusion Models},
author = {Jincheng Zhang and György Fazekas and Charalampos Saitis},
journal= {arXiv preprint arXiv:2310.14044},
year = {2024}
}