快速时间条件潜在音频扩散
声音
2024-05-14 v3 机器学习
音频与语音处理
摘要
从文本提示生成长格式 44.1kHz 立体声音频可能计算量巨大。此外,大多数先前的工作并未解决音乐和音效在持续时间上自然变化的问题。我们的研究专注于使用生成模型,基于文本提示高效生成 44.1kHz 的长格式、可变长度立体声音乐和声音。Stable Audio 基于潜在扩散,其潜在空间由全卷积变分自编码器定义。它以文本提示和时间嵌入为条件,允许对生成音乐和声音的内容及长度进行精细控制。Stable Audio 能够在 A100 GPU 上于 8 秒内渲染长达 95 秒的 44.1kHz 立体声信号。尽管具有计算效率和快速推理能力,它在两个公开的文本到音乐和文本到音频基准测试中表现最佳之一,并且与最先进模型不同的是,它能够生成具有结构感的音乐和立体声声音。
引用
@article{arxiv.2402.04825,
title = {Fast Timing-Conditioned Latent Audio Diffusion},
author = {Zach Evans and CJ Carr and Josiah Taylor and Scott H. Hawley and Jordi Pons},
journal= {arXiv preprint arXiv:2402.04825},
year = {2024}
}
备注
Accepted to ICML 2024. Code: https://github.com/Stability-AI/stable-audio-tools. Metrics: https://github.com/Stability-AI/stable-audio-metrics. Demo: https://stability-ai.github.io/stable-audio-demo