中文

MIDI-Sandwich:用于符号单轨音乐生成的多模型多任务层次条件VAE-GAN网络

音频与语音处理 2019-07-05 v2 机器学习 多媒体 声音

摘要

大多数现有的用于音乐生成的神经网络模型探索如何生成音乐小节,然后直接将音乐小节拼接成一首歌曲。然而,这些方法没有探索小节之间的关系,且连接而成的歌曲作为一个整体没有曲式结构和音乐方向感。为解决此问题,我们提出了一种多模型多任务层次条件VAE-GAN(变分自编码器-生成对抗网络)网络,名为MIDI-Sandwich,其结合了曲式、主音和旋律运动等音乐知识。MIDI-Sandwich有两个子模型:层次条件变分自编码器(HCVAE)和层次条件生成对抗网络(HCGAN)。HCVAE使用层次结构。HCVAE的底层使用局部条件变分自编码器(L-CVAE)来生成由首末音符(FLN)预先指定的音乐小节。HCVAE的上层使用全局变分自编码器(G-VAE)来分析由L-CVAE编码器生成的隐向量序列,以探索小节之间的音乐关系,并生成由L-CVAE解码器生成的多个音乐小节拼接而成的歌曲,使歌曲既具有音乐结构又具有方向感。同时,HCVAE将其一部分与HCGAN共享,以进一步提高生成音乐的性能。MIDI-Sandwich在Nottingham数据集上得到验证,能够生成单轨旋律序列(17x8拍),优于大多数生成模型的长度(8至32拍)。同时,参考许多经典文献的实验方法,对生成的音乐进行质量评估。上述实验证明了该模型的有效性。

关键词

引用

@article{arxiv.1907.01607,
  title  = {MIDI-Sandwich: Multi-model Multi-task Hierarchical Conditional VAE-GAN networks for Symbolic Single-track Music Generation},
  author = {Xia Liang and Junmin Wu and Yan Yin},
  journal= {arXiv preprint arXiv:1907.01607},
  year   = {2019}
}

备注

cast KSEM2019 on May 3, 2019 (weak rejected)