中文

利用逆序列变换学习律动演奏

声音 2019-07-29 v2 机器学习 多媒体 音频与语音处理 机器学习

摘要

我们探索使用 Seq2Seq 与循环变分信息瓶颈 (Variational Information Bottleneck, VIB) 模型,将抽象音乐构思(乐谱、节奏)转化为富有表现力的演奏的模型。尽管 Seq2Seq 模型通常需要精心对齐的语料,我们表明可借鉴生成对抗网络 (Generative Adversarial Network, GAN) 文献(例如 Pix2Pix (Isola et al., 2017) 与 Vid2Vid (Wang et al. 2018a))中针对序列的方法,通过执行简单变换并训练生成模型以合理反转这些变换,从而创建大量配对数据。音乐,尤其是鼓点演奏,为此方法提供了有力的测试用例,因为许多常见变换(量化、移除声部)具有清晰语义,且学习反转它们的模型具有现实应用。聚焦于鼓手这一情形,我们为此创建并发布了一个新数据集,包含超过 13 小时由专业鼓手录制、并与细粒度时序和力度信息对齐的录音。我们还探索了这些模型的一些创作潜力,包括展示在人本化 (Humanization)(由乐谱实例化演奏)上对比最先进方法的改进。

关键词

引用

@article{arxiv.1905.06118,
  title  = {Learning to Groove with Inverse Sequence Transformations},
  author = {Jon Gillick and Adam Roberts and Jesse Engel and Douglas Eck and David Bamman},
  journal= {arXiv preprint arXiv:1905.06118},
  year   = {2019}
}

备注

Blog post and links: https://g.co/magenta/groovae