Stable Audio Open
声音
2024-08-01 v2 人工智能
音频与语音处理
摘要
开放式生成模型对社区至关重要,它允许进行微调,并在提出新模型时作为基线。然而,当前大多数文本到音频模型是私有的,艺术家和研究人员无法在其基础上进行构建。本文描述了一个新的开放权重文本到音频模型的架构和训练过程,该模型使用Creative Commons数据训练。我们的评估表明,该模型的性能在各种指标上均与最先进水平具有竞争力。值得注意的是,报告的FDopenl3结果(衡量生成音频的真实感)展示了其在44.1kHz下进行高质量立体声音频合成的潜力。
引用
@article{arxiv.2407.14358,
title = {Stable Audio Open},
author = {Zach Evans and Julian D. Parker and CJ Carr and Zack Zukowski and Josiah Taylor and Jordi Pons},
journal= {arXiv preprint arXiv:2407.14358},
year = {2024}
}
备注
Demo: https://stability-ai.github.io/stable-audio-open-demo/ Weights: https://huggingface.co/stabilityai/stable-audio-open-1.0 Code: https://github.com/Stability-AI/stable-audio-tools. arXiv admin note: text overlap with arXiv:2404.10301