用于学习音乐长期结构的一种层次化潜向量模型
机器学习
2019-11-12 v5 声音
音频与语音处理
机器学习
摘要
变分自编码器(VAE)已被证明是为自然数据生成语义上有意义的潜表示的有效模型。然而,迄今为止它在序列数据上的应用有限,并且正如我们所展示的,现有的循环 VAE 模型难以对具有长期结构的序列建模。为解决此问题,我们提出使用一种层次化解码器,它首先输出输入子序列的嵌入,然后利用这些嵌入独立地生成每个子序列。这种结构鼓励模型利用其潜代码,从而避免了仍困扰循环 VAE 的“后验坍缩”问题。我们将该架构应用于对音符序列建模,发现其采样、插值和重构性能均显著优于“扁平”基线模型。我们的“MusicVAE”实现可在 http://g.co/magenta/musicvae-code 在线获取。
引用
@article{arxiv.1803.05428,
title = {A Hierarchical Latent Vector Model for Learning Long-Term Structure in Music},
author = {Adam Roberts and Jesse Engel and Colin Raffel and Curtis Hawthorne and Douglas Eck},
journal= {arXiv preprint arXiv:1803.05428},
year = {2019}
}
备注
ICML Camera Ready Version (w/ fixed typos)