中文

用于可控表达性钢琴演奏音频合成的生成式建模

音频与语音处理 2020-07-14 v2 机器学习 多媒体 声音

摘要

我们提出了一种基于高斯混合变分自编码器(GM-VAE)的可控神经音频合成器,它能够在音频域中生成逼真的钢琴演奏,并紧密遵循钢琴演奏两个基本风格特征的时间条件:连奏与力度。我们展示了该模型如何在合成音频的过程中对风格进行细粒度渐变。这基于作为条件的潜变量,这些变量可从先验中采样或从其他乐曲中推断得到。设想的用例之一是为现有钢琴乐曲激发富有创意的全新诠释。

关键词

引用

@article{arxiv.2006.09833,
  title  = {Generative Modelling for Controllable Audio Synthesis of Expressive Piano Performance},
  author = {Hao Hao Tan and Yin-Jyun Luo and Dorien Herremans},
  journal= {arXiv preprint arXiv:2006.09833},
  year   = {2020}
}