中文

IMPACT:基于扩散建模的文本到音频生成迭代掩码并行解码

音频与语音处理 2025-06-03 v1 声音

摘要

文本到音频生成根据自然语言提示合成逼真的声音或音乐。基于扩散的框架,包括 Tango 和 AudioLDM 系列,代表了文本到音频生成的最新技术水平。尽管实现了高音频保真度,但由于缓慢的扩散采样过程,它们产生了显著的推理延迟。MAGNET 是一种在离散 token 上运行的基于掩码的模型,通过基于迭代掩码的并行解码解决了推理缓慢的问题。然而,其音频质量仍落后于基于扩散的模型。在这项工作中,我们引入了 IMPACT,这是一个文本到音频生成框架,在确保快速推理的同时,在音频质量和保真度方面实现了高性能。IMPACT 在由扩散建模驱动的连续潜在空间中利用基于迭代掩码的并行解码。这种方法消除了离散 token 的保真度限制,同时保持了具有竞争力的推理速度。在 AudioCaps 上的结果表明,IMPACT 在包括 Fréchet Distance (FD) 和 Fréchet Audio Distance (FAD) 在内的关键指标上达到了最新技术水平,同时与先前的模型相比显著降低了延迟。项目网站可在 https://audio-impact.github.io/ 获取。

关键词

引用

@article{arxiv.2506.00736,
  title  = {IMPACT: Iterative Mask-based Parallel Decoding for Text-to-Audio Generation with Diffusion Modeling},
  author = {Kuan-Po Huang and Shu-wen Yang and Huy Phan and Bo-Ru Lu and Byeonggeun Kim and Sashank Macha and Qingming Tang and Shalini Ghosh and Hung-yi Lee and Chieh-Chi Kao and Chao Wang},
  journal= {arXiv preprint arXiv:2506.00736},
  year   = {2025}
}

备注

Accepted by ICML 2025. Project website: https://audio-impact.github.io/