中文

DiffuseRoll:基于扩散模型的多音轨多类别音乐生成

声音 2023-03-15 v1 多媒体 音频与语音处理

摘要

生成模型的最新进展在音乐生成方面取得了显著进步。然而,现有大多数方法侧重于生成单声部或主调音乐,而生成具有丰富属性的复调与多音轨音乐仍是一项具有挑战性的任务。本文提出一种利用扩散模型进行多音轨、多属性交响音乐生成的新方法。具体而言,我们使用扩散模型生成钢琴卷帘(piano-roll)表示,并将其映射为 MIDI 格式输出。为捕捉丰富的属性信息,我们引入一种颜色编码方案,将音符序列编码为表示音高、力度和乐器的颜色与位置信息。该方案实现了离散音乐序列与连续图像之间的无缝映射。我们还提出一种后处理方法以优化生成的乐谱,从而获得更好的效果。实验结果表明,与对比方法相比,我们的方法在具有丰富属性信息的复调音乐生成方面优于最先进(state-of-the-art)的方法。

关键词

引用

@article{arxiv.2303.07794,
  title  = {DiffuseRoll: Multi-track multi-category music generation based on diffusion model},
  author = {Hongfei Wang},
  journal= {arXiv preprint arXiv:2303.07794},
  year   = {2023}
}