中文

Jukebox:一种音乐生成模型

音频与语音处理 2020-05-04 v1 机器学习 声音 机器学习

摘要

我们介绍了 Jukebox,一种在原始音频域中生成带演唱音乐的作品的模型。我们利用多尺度 VQ-VAE 压缩原始音频的长上下文为离散编码,并使用自回归 Transformer 对这些编码建模。我们表明,该组合模型在规模上能够生成高保真且多样的歌曲,连贯性可达数分钟。我们可以以艺术家和流派为条件来引导音乐与声乐风格,并以未对齐的歌词为条件使演唱更具可控性。我们在 https://jukebox.openai.com 发布了数千个非精选样本,并在 https://github.com/openai/jukebox 提供了模型权重与代码。

关键词

引用

@article{arxiv.2005.00341,
  title  = {Jukebox: A Generative Model for Music},
  author = {Prafulla Dhariwal and Heewoo Jun and Christine Payne and Jong Wook Kim and Alec Radford and Ilya Sutskever},
  journal= {arXiv preprint arXiv:2005.00341},
  year   = {2020}
}