中文

RAVE:一种用于快速高质量神经音频合成的变分自编码器

机器学习 2021-12-16 v2 声音 音频与语音处理

摘要

应用于音频的深度生成模型在许多语音和音乐相关任务中将最先进水平大幅提升。然而,由于原始波形建模本质上是一项困难任务,音频生成模型要么计算密集,要么依赖低采样率,要么难以控制,要么限制了可能信号的性质。在这些模型中,变分自编码器(VAE)通过暴露潜变量提供了对生成的控制,尽管它们通常存在合成质量低的问题。本文中,我们介绍了一种实时音频变分自编码器(RAVE),可实现快速且高质量的音频波形合成。我们提出了一种新颖的两阶段训练流程,即表示学习和对抗微调。我们展示了通过对潜空间进行训练后分析,可以在重建保真度与表示紧凑性之间实现直接控制。通过利用原始波形的多频带分解,我们展示了我们的模型是首个能够生成48kHz音频信号,同时在标准笔记本电脑CPU上以比实时快20倍的速度运行的模型。我们使用定量和定性主观实验评估合成质量,并展示了相比现有方法的优越性。最后,我们给出了模型在音色迁移和信号压缩中的应用。我们所有的源代码和音频示例均公开可用。

关键词

引用

@article{arxiv.2111.05011,
  title  = {RAVE: A variational autoencoder for fast and high-quality neural audio synthesis},
  author = {Antoine Caillon and Philippe Esling},
  journal= {arXiv preprint arXiv:2111.05011},
  year   = {2021}
}