EzAudio:利用高效 Diffusion Transformer 增强文本到音频生成
音频与语音处理
2025-06-23 v2 声音
摘要
我们引入了 EzAudio,这是一个旨在生成高质量、自然逼真音效的文本到音频 (T2A) 生成框架。核心设计包括:(1) 我们提出了 EzAudio-DiT,一种针对音频潜在表示优化的 Diffusion Transformer (DiT),旨在提高收敛速度以及参数和内存效率。(2) 我们应用了无分类器引导 (CFG) 重缩放技术,以减轻较高 CFG 分数下的保真度损失,并在不损害音频质量的前提下增强提示依从性。(3) 我们提出了一种合成描述生成策略,利用音频理解和 LLM 的最新进展来增强 T2A 预训练。我们表明,EzAudio 凭借其计算高效的架构和快速收敛性,成为一个极具竞争力的开源模型,通过提供高度逼真的听觉体验,在客观和主观评估中均表现出色。代码、数据和预训练模型发布于:https://haidog-yaqub.github.io/EzAudio-Page/。
引用
@article{arxiv.2409.10819,
title = {EzAudio: Enhancing Text-to-Audio Generation with Efficient Diffusion Transformer},
author = {Jiarui Hai and Yong Xu and Hao Zhang and Chenxing Li and Helin Wang and Mounya Elhilali and Dong Yu},
journal= {arXiv preprint arXiv:2409.10819},
year = {2025}
}
备注
Accepted at Interspeech 2025