AudioGAN:用于实时高保真文本到音频生成的紧凑高效框架
声音
2025-12-30 v1 音频与语音处理
摘要
文本到音频(TTA)生成可显著降低媒体行业的生产成本并提升工作效率。然而,当前大多数 TTA 模型(主要基于扩散模型)存在推理速度慢、计算成本高的局限。本文引入 AudioGAN,首个成功实现基于生成对抗网络(GANs)的 TTA 框架,能够单次生成音频,从而降低模型复杂度和推理时间。为克服 GANs 天然训练难题,我们整合多种对抗损失,提出创新组件单双三元(SDT)注意力和时频交叉注意力(TF-CA)。在 AudioCaps 数据集上进行大量实验表明,AudioGAN 在实现国际前沿性能的同时,使用参数减少 90%,运行速度提升 20 倍,音频生成时间控制在一秒以内。这些结果将 AudioGAN 确立为实时 TTA 的实用且强大解决方案。
引用
@article{arxiv.2512.22166,
title = {AudioGAN: A Compact and Efficient Framework for Real-Time High-Fidelity Text-to-Audio Generation},
author = {HaeChun Chung},
journal= {arXiv preprint arXiv:2512.22166},
year = {2025}
}
备注
10 pages, 6 figures, Accepted to AES AIMLA 2025