面向结构化自动音乐的条件化深度生成原始音频模型
声音
2018-06-27 v1 机器学习
音频与语音处理
机器学习
摘要
现有采用深度学习的自动音乐生成方法可大致分为两类:原始音频模型与符号模型。在音符层级训练与生成的符号模型目前是更主流的方法;这类模型能捕捉旋律结构的长程依赖,却无法把握原始音频生成的细微差别与丰富性。诸如 DeepMind 的 WaveNet 等原始音频模型直接在采样音频波形上训练,使它们能生成听感真实但无结构的音乐。本文中,我们提出一种结合这两类方法的自动音乐生成方法论,以创作结构化且听感真实的乐曲。我们考虑用长短期记忆(Long Short Term Memory)网络学习不同风格音乐的旋律结构,再将此模型生成的独特符号序列作为条件输入到基于 WaveNet 的原始音频生成器中,从而构建自动新颖音乐的模型。随后我们通过展示本工作的结果来评估该方法。
引用
@article{arxiv.1806.09905,
title = {Conditioning Deep Generative Raw Audio Models for Structured Automatic Music},
author = {Rachel Manzelli and Vijay Thakkar and Ali Siahkamari and Brian Kulis},
journal= {arXiv preprint arXiv:1806.09905},
year = {2018}
}
备注
Presented at the ISMIR 2018 Conference