中文

FdAudio:基于MeanFlow锚定的Fréchet距离后训练用于一步文本到音频生成

音频与语音处理 2026-07-11 v1 声音

摘要

尽管近期诸如MeanAudio等少步采样文本到音频生成模型通过建模平均速度显著加速了生成过程,但其严格的一步生成质量仍明显落后于多步对应模型。我们提出FdAudio以弥合这一差距。与仅依赖对目标速度场回归的MeanAudio不同,我们的后训练方法通过多表示Fréchet距离(FD)损失,直接在预训练嵌入空间中优化最终的一步分布。关键在于,为防止朴素FD损失后训练导致的多步退化,我们引入MeanFlow一致性目标作为结构锚定。结果表明,FdAudio在少步系统中建立了最先进的一步T2A生成质量,相较于基线MeanAudio框架,FD分数降低了11.4%,FAD分数提升了28.8%。值得注意的是,我们通过提出MeanFlow锚定解决了FD后训练朴素多步退化问题,使得25步采样路径能够保持高保真音频合成,在计算延迟的一小部分内达到或超越强多步模型的性能。

关键词

引用

@article{arxiv.2607.10421,
  title  = {FdAudio: MeanFlow-Anchored Fréchet-Distance Post-Training for One-Step Text-to-Audio Generation},
  author = {Kuan-Po Huang and Bo-Ru Lu and Ho-Lam Chung and Shih-Hsin Wang and Hung-yi Lee},
  journal= {arXiv preprint arXiv:2607.10421},
  year   = {2026}
}

备注

Project website: https://fdoneaudio.github.io/