中文

MIDI-Sandwich2:基于 RNN 的分层多模态融合生成 VAE 网络用于多轨符号音乐生成

机器学习 2019-09-10 v1 声音 音频与语音处理

摘要

目前,几乎所有多轨音乐生成模型都使用卷积神经网络(CNN)来构建生成模型,而基于循环神经网络(RNN)的模型无法应用于该任务。针对上述问题,本文提出一种基于 RNN 的分层多模态融合生成变分自编码器(VAE)网络 MIDI-Sandwich2,用于多轨符号音乐生成。受 VQ-VAE2 启发,MIDI-Sandwich2 通过使用多个不共享权重的独立二值变分自编码器(BVAE)模型处理各轨信息,扩展了原始分层模型的维度。随后,利用多模态融合技术,上层名为多模态融合生成 VAE(MFG-VAE)将各轨生成的潜空间向量进行组合,并使用解码器进行升维重建,以模拟多模态融合的逆操作——多模态生成,从而实现基于 RNN 的多轨符号音乐生成。针对多轨格式 pianoroll,我们还改进了 MuseGAN 的输出二值化方法,解决了原方案细化步骤难以微分、梯度难以下降的问题,使生成的歌曲更具表现力。该模型在 Lakh Pianoroll Dataset(LPD)多轨数据集上进行了验证。与 MuseGAN 相比,MIDI-Sandwich2 不仅能生成和谐的多轨音乐,生成质量也接近 SOTA 水平。同时,通过使用 VAE 还原歌曲,MIDI-Sandwich2 复现的半生成歌曲比 MuseGAN 生成的纯自动生成音乐更优美。代码与试听音频样本均已开源:https://github.com/LiangHsia/MIDI-S2。

关键词

引用

@article{arxiv.1909.03522,
  title  = {MIDI-Sandwich2: RNN-based Hierarchical Multi-modal Fusion Generation VAE networks for multi-track symbolic music generation},
  author = {Xia Liang and Junmin Wu and Jing Cao},
  journal= {arXiv preprint arXiv:1909.03522},
  year   = {2019}
}