中文

显式结构编码的深度神经网络对符号音乐生成的影响

声音 2020-03-03 v3 人工智能 机器学习 音频与语音处理

摘要

随着人工神经网络的近期突破,深度生成模型已成为计算创造力的主要技术之一。尽管在图像与短序列生成方面取得了非常有前景的进展,符号音乐生成仍是一个具有挑战性的问题,因为作品的结构通常较为复杂。在本研究中,我们尝试解决由给定和弦进行约束的旋律生成问题。这一音乐元创作问题也可被纳入一个具有用户输入与预测性结构输出的计划识别系统中。具体而言,我们通过比较两种序列生成模型:LSTM(一种 RNN)与 WaveNet(扩张时间卷积神经网络,dilated temporal-CNN),来探究显式架构编码音乐结构的影响。据我们所知,这是首个将 WaveNet 应用于符号音乐生成的研究,也是首个针对音乐生成在时间卷积神经网络(temporal-CNN)与 RNN 之间进行的系统性比较。我们在生成结果评估中开展了一项调查,并实现了可变马尔可夫预言机(Variable Markov Oracle)用于音乐模式发现。实验结果表明,使用堆叠扩张卷积层更显式地编码结构显著提升了性能,而将底层和弦进行全局编码入生成过程则带来更大增益。

关键词

引用

@article{arxiv.1811.08380,
  title  = {The Effect of Explicit Structure Encoding of Deep Neural Networks for Symbolic Music Generation},
  author = {Ke Chen and Weilin Zhang and Shlomo Dubnov and Gus Xia and Wei Li},
  journal= {arXiv preprint arXiv:1811.08380},
  year   = {2020}
}

备注

8 pages, 13 figures