中文

用于情感可控符号音乐生成的快速扩散 GAN 模型

声音 2023-10-24 v1 人工智能 音频与语音处理

摘要

扩散模型在图像与音频合成等连续数据的一系列生成任务中已展现出有前景的结果。然而,在利用扩散模型生成离散符号音乐方面进展甚微,因为这新型生成模型不太适用于离散数据,且其迭代采样过程计算代价高昂。在本工作中,我们提出一种结合生成对抗网络(GAN)的扩散模型,旨在(i)缓解算法音乐生成中朝向目标情感控制生成这一尚存挑战,以及(ii)减轻扩散模型应用于符号音乐生成时的慢采样缺陷。我们首先使用训练好的变分自编码器获得带情感标签的符号音乐数据集的嵌入,然后用这些嵌入训练扩散模型。我们的结果证明了我们的扩散模型能成功控制以生成具有期望情感的符号音乐。我们的模型在计算代价上实现了数个数量级的改进,仅需四个时间步去噪,而当前最先进的符号音乐生成扩散模型所需步数在千量级。

关键词

引用

@article{arxiv.2310.14040,
  title  = {Fast Diffusion GAN Model for Symbolic Music Generation Controlled by Emotions},
  author = {Jincheng Zhang and György Fazekas and Charalampos Saitis},
  journal= {arXiv preprint arXiv:2310.14040},
  year   = {2023}
}