中文

用于学习音乐长期结构的一种层次化潜向量模型

机器学习 2019-11-12 v5 声音 音频与语音处理 机器学习

摘要

变分自编码器(VAE)已被证明是为自然数据生成语义上有意义的潜表示的有效模型。然而,迄今为止它在序列数据上的应用有限,并且正如我们所展示的,现有的循环 VAE 模型难以对具有长期结构的序列建模。为解决此问题,我们提出使用一种层次化解码器,它首先输出输入子序列的嵌入,然后利用这些嵌入独立地生成每个子序列。这种结构鼓励模型利用其潜代码,从而避免了仍困扰循环 VAE 的“后验坍缩”问题。我们将该架构应用于对音符序列建模,发现其采样、插值和重构性能均显著优于“扁平”基线模型。我们的“MusicVAE”实现可在 http://g.co/magenta/musicvae-code 在线获取。

关键词

引用

@article{arxiv.1803.05428,
  title  = {A Hierarchical Latent Vector Model for Learning Long-Term Structure in Music},
  author = {Adam Roberts and Jesse Engel and Colin Raffel and Curtis Hawthorne and Douglas Eck},
  journal= {arXiv preprint arXiv:1803.05428},
  year   = {2019}
}

备注

ICML Camera Ready Version (w/ fixed typos)