中文

Woosh: 音效基础模型

声音 2026-04-30 v3 人工智能 机器学习

摘要

音频研究界依赖开源生成模型作为构建新方法和建立基准的基础工具。在本报告中,我们介绍了Woosh,即索尼AI公开发布的音效基础模型,详细说明了其架构、训练过程以及与其他流行开源模型的评估。由于针对音效进行了优化,我们提供了(1)一个高质量音频编解码器模型和(2)一个文本-音频对齐模型用于条件化,以及(3)文本到音频和(4)视频到音频生成模型。发布中还包含了蒸馏的文本到音频和视频到音频模型,支持低资源操作和快速推理。我们在公开和私有数据上的评估显示,每个模块与现有开源替代方案(如StableAudio-Open和TangoFlux)相比具有竞争性或更优的性能。推理代码和模型权重可在https://github.com/SonyResearch/Woosh获取。演示样本可在https://sonyresearch.github.io/Woosh/获取。

关键词

引用

@article{arxiv.2604.01929,
  title  = {Woosh: A Sound Effects Foundation Model},
  author = {Gaëtan Hadjeres and Marc Ferras and Khaled Koutini and Benno Weck and Alexandre Bittar and Thomas Hummel and Zineb Lahrichi and Hakim Missoum and Joan Serrà and Yuki Mitsufuji},
  journal= {arXiv preprint arXiv:2604.01929},
  year   = {2026}
}