用于可控表达性钢琴演奏音频合成的生成式建模
音频与语音处理
2020-07-14 v2 机器学习
多媒体
声音
摘要
我们提出了一种基于高斯混合变分自编码器(GM-VAE)的可控神经音频合成器,它能够在音频域中生成逼真的钢琴演奏,并紧密遵循钢琴演奏两个基本风格特征的时间条件:连奏与力度。我们展示了该模型如何在合成音频的过程中对风格进行细粒度渐变。这基于作为条件的潜变量,这些变量可从先验中采样或从其他乐曲中推断得到。设想的用例之一是为现有钢琴乐曲激发富有创意的全新诠释。
关键词
引用
@article{arxiv.2006.09833,
title = {Generative Modelling for Controllable Audio Synthesis of Expressive Piano Performance},
author = {Hao Hao Tan and Yin-Jyun Luo and Dorien Herremans},
journal= {arXiv preprint arXiv:2006.09833},
year = {2020}
}