中文

ETTA: 揭示文本到音频模型设计空间

声音 2025-07-02 v2 计算与语言 机器学习 音频与语音处理

摘要

近年来,文本到音频(TTA)合成取得了显著进展,使用户能够通过自然语言提示生成合成音频来丰富其创作工作流程。尽管如此,数据、模型架构、训练目标函数和采样策略对目标基准的影响仍不太明确。为提供对TTA模型设计空间的整体理解,我们设置了一个大规模经验实验,专注于扩散和流匹配模型。我们的贡献包括: 1) AF-Synthetic,一大型高质量合成标题数据集,来自音频理解模型; 2) 对不同TTA模型架构、训练和推理设计选择的系统比较; 3) 对采样方法及其相对于生成质量和推理速度的帕累托曲线的分析。我们利用这项广泛分析所获知识,提出我们最佳模型,称为揭示文本到音频(ETTA)。在AudioCaps和MusicCaps上评估时,ETTA在公开数据上训练的基线模型上提供了改进,同时与在专有数据上训练的模型保持竞争力。最后,我们展示了ETTA在生成跟随复杂且富有想象力的标题的创意音频方面的改进能力——这一任务比当前基准更具挑战性。

关键词

引用

@article{arxiv.2412.19351,
  title  = {ETTA: Elucidating the Design Space of Text-to-Audio Models},
  author = {Sang-gil Lee and Zhifeng Kong and Arushi Goel and Sungwon Kim and Rafael Valle and Bryan Catanzaro},
  journal= {arXiv preprint arXiv:2412.19351},
  year   = {2025}
}

备注

ICML 2025. Demo: https://research.nvidia.com/labs/adlr/ETTA/ Code: https://github.com/NVIDIA/elucidated-text-to-audio