Stable Audio 3
声音
2026-05-19 v1 人工智能
摘要
Stable Audio 3 是一个由快速潜在扩散模型(小型、中型、大型)组成的家族,用于可变长度的音频生成与编辑。由于我们的模型可生成数分钟的音频,可变长度生成对于避免为短时声音生成完整长度音频至关重要。我们也支持图像修复,实现针对性的音频编辑和短录音的续播。我们的潜在扩散模型基于一种新颖的语义-声学自编码器,后者将音频投射到紧凑的潜在空间中,实现高效的扩散生成,同时保持音频保真度并鼓励潜在空间中的语义结构。最后,我们进行对抗性后训练,以加速推理并提升生成质量,减少推理步骤,同时提升保真度和提示遵循程度。Stable Audio 3 模型在经许可和 Creative Commons 许可的数据上训练,可在 H200 GPU 上在 2 秒内生成音乐和声音,在 MacBook Pro M4 上用几秒钟即可完成。我们发布了小型和中型模型的权重,这些模型可在消费级硬件上运行,同时发布其训练和推理管道。
引用
@article{arxiv.2605.17991,
title = {Stable Audio 3},
author = {Zach Evans and Julian D. Parker and Matthew Rice and CJ Carr and Zack Zukowski and Josiah Taylor and Jordi Pons},
journal= {arXiv preprint arXiv:2605.17991},
year = {2026}
}
备注
Training code: https://github.com/Stability-AI/stable-audio-tools Inference and weights: http://github.com/Stability-AI/stable-audio-3