中文

Stable Audio Open

声音 2024-08-01 v2 人工智能 音频与语音处理

摘要

开放式生成模型对社区至关重要,它允许进行微调,并在提出新模型时作为基线。然而,当前大多数文本到音频模型是私有的,艺术家和研究人员无法在其基础上进行构建。本文描述了一个新的开放权重文本到音频模型的架构和训练过程,该模型使用Creative Commons数据训练。我们的评估表明,该模型的性能在各种指标上均与最先进水平具有竞争力。值得注意的是,报告的FDopenl3结果(衡量生成音频的真实感)展示了其在44.1kHz下进行高质量立体声音频合成的潜力。

关键词

引用

@article{arxiv.2407.14358,
  title  = {Stable Audio Open},
  author = {Zach Evans and Julian D. Parker and CJ Carr and Zack Zukowski and Josiah Taylor and Jordi Pons},
  journal= {arXiv preprint arXiv:2407.14358},
  year   = {2024}
}

备注

Demo: https://stability-ai.github.io/stable-audio-open-demo/ Weights: https://huggingface.co/stabilityai/stable-audio-open-1.0 Code: https://github.com/Stability-AI/stable-audio-tools. arXiv admin note: text overlap with arXiv:2404.10301