真实音乐生成的挑战:大规模原始音频建模
声音
2018-06-28 v1 机器学习
音频与语音处理
机器学习
摘要
真实的音乐生成是一项具有挑战性的任务。当构建从数据学习的音乐生成模型时,通常使用诸如乐谱或 MIDI 之类的高层表示,这些表示抽象掉了特定演奏的特质。但这些细微差别对我们感知音乐性与真实感非常重要,因此在这项工作中我们着手在原始音频域中对音乐建模。已有研究表明自回归模型擅长生成语音的原始音频波形,但当应用于音乐时,我们发现它们偏向于捕捉局部信号结构,而以牺牲对长程相关性的建模为代价。这是有问题的,因为音乐在许多不同时间尺度上展现结构。在这项工作中,我们探索自回归离散自编码器(ADAs)作为使自回归模型能够捕捉波形中长程相关性的手段。我们发现它们允许我们直接在原始音频域中无条件生成钢琴音乐,其在数十秒范围内展现出风格一致性。
引用
@article{arxiv.1806.10474,
title = {The challenge of realistic music generation: modelling raw audio at scale},
author = {Sander Dieleman and Aäron van den Oord and Karen Simonyan},
journal= {arXiv preprint arXiv:1806.10474},
year = {2018}
}
备注
13 pages, 2 figures, submitted to NIPS 2018