中文

基于对抗后训练的快速文本到音频生成

声音 2025-05-21 v3 人工智能 机器学习 多媒体 音频与语音处理

摘要

文本到音频系统虽然性能日益提升,但推理速度较慢,使得其延迟难以满足许多创意应用的需求。我们提出了对抗性相对-对比(ARC)后训练方法,这是首个基于对抗训练的扩散/流模型加速算法,不同于基于蒸馏的方法。尽管过去的对抗后训练方法在与高昂蒸馏方法进行比较时一直走弯路,但 ARC 后训练只需一个简单的步骤:1)将最新的相对对抗公式推广到扩散/流模型后训练中;2)将其与一种新颖的对比判别器目标相结合,以鼓励更好的提示遵循性。我们将 ARC 后训练与若干优化技术结合用于 Stable Audio Open,构建了一个 capable 在 H100 上约 75 毫秒生成约 12 秒、44.1 kHz 立体声音频,或在移动边缘设备上约 7 秒生成的模型,我们的模型是迄今为止最快的文本到音频模型。

关键词

引用

@article{arxiv.2505.08175,
  title  = {Fast Text-to-Audio Generation with Adversarial Post-Training},
  author = {Zachary Novack and Zach Evans and Zack Zukowski and Josiah Taylor and CJ Carr and Julian Parker and Adnan Al-Sinan and Gian Marco Iodice and Julian McAuley and Taylor Berg-Kirkpatrick and Jordi Pons},
  journal= {arXiv preprint arXiv:2505.08175},
  year   = {2025}
}