中文

基于扩散模型的符号音乐生成

声音 2021-11-29 v2 机器学习 音频与语音处理 机器学习

摘要

基于分数的生成模型和扩散概率模型已在图像和音频等连续域中成功生成高质量样本。然而,由于其受Langevin启发的采样机制,它们在离散和序列数据上的应用受到限制。本工作中,我们提出一种通过在预训练变分自编码器的连续潜空间中参数化离散域来在序列数据上训练扩散模型的技术。我们的方法是非自回归的,学习通过反向过程生成潜嵌入序列,并以恒定数量的迭代细化步骤提供并行生成。我们将该技术应用于符号音乐建模,并与在相同连续嵌入上运行的自回归语言模型相比,展示了强大的无条件生成和事后条件填充结果。

关键词

引用

@article{arxiv.2103.16091,
  title  = {Symbolic Music Generation with Diffusion Models},
  author = {Gautam Mittal and Jesse Engel and Curtis Hawthorne and Ian Simon},
  journal= {arXiv preprint arXiv:2103.16091},
  year   = {2021}
}

备注

ISMIR 2021