中文

MuseGAN: 用于符号音乐生成与伴奏的多轨序列生成对抗网络

音频与语音处理 2020-08-06 v2 人工智能 机器学习 声音 机器学习

摘要

生成音乐与生成图像和视频有一些显著差异。首先,音乐是一门时间的艺术,需要时间模型。其次,音乐通常由多种乐器/轨组成,具有各自的时间动态,但它们在时间上相互依赖地展开。最后,在复调音乐中,音符通常被分组为和弦、琶音或旋律,因此引入音符的时间顺序并不自然适用。在本文中,我们在生成对抗网络 框架下提出了三种用于符号多轨音乐生成的模型。这三种模型在基本假设以及相应的网络架构上有所不同,分别被称为即兴模型、作曲家模型和混合模型。我们在包含超过十万个摇滚音乐小节的数据集上训练了所提出的模型,并将它们应用于生成五轨的钢琴卷帘:贝斯、鼓、吉他、钢琴和弦乐。除了主观用户研究外,还提出了一些轨内和轨间客观指标来评估生成结果。我们表明,我们的模型可以从零开始(即无需人类输入)生成连贯的四小节音乐。我们还将模型扩展到人机协作音乐生成:给定由人类创作的特定轨,我们可以生成四个额外的轨来为其伴奏。所有代码、数据集和渲染的音频样本均可在 https://salu133445.github.io/musegan/ 获取。

关键词

引用

@article{arxiv.1709.06298,
  title  = {MuseGAN: Multi-track Sequential Generative Adversarial Networks for Symbolic Music Generation and Accompaniment},
  author = {Hao-Wen Dong and Wen-Yi Hsiao and Li-Chia Yang and Yi-Hsuan Yang},
  journal= {arXiv preprint arXiv:1709.06298},
  year   = {2020}
}

备注

to appear at AAAI 2018