中文

MeanAudio:基于均值流的快速高保真文本到音频生成

声音 2025-10-23 v2 人工智能

摘要

近年来,文本到音频生成(TTA)取得了显著进展,为声音创作者提供了将灵感转化为生动音频的强大工具。然而,尽管取得了这些进展,当前的 TTA 系统往往存在推理速度慢的问题,这极大地阻碍了音频创作的效率和流畅性。在本文中,我们提出了 MeanAudio,这是一种快速且高保真的文本到音频生成器,仅需一次函数评估(1-NFE)即可渲染逼真的声音。MeanAudio 利用了:(i)带有引导速度目标的 MeanFlow 目标,显著加速了推理速度;(ii)增强的 Flux 风格 Transformer,配备双文本编码器,以实现更好的语义对齐和合成质量;(iii)高效的瞬时到均值课程学习,加速了收敛并支持在消费级 GPU 上进行训练。通过全面的评估研究,我们证明 MeanAudio 在单步音频生成中达到了最先进的性能。具体而言,它在单个 NVIDIA RTX 3090 上实现了 0.013 的实时因子(RTF),比当前最先进的基于扩散的 TTA 系统提速 100 倍。此外,MeanAudio 在多步生成中也表现出强大的性能,能够在连续的合成步骤之间实现平滑过渡。

关键词

引用

@article{arxiv.2508.06098,
  title  = {MeanAudio: Fast and Faithful Text-to-Audio Generation with Mean Flows},
  author = {Xiquan Li and Junxi Liu and Yuzhe Liang and Zhikang Niu and Wenxi Chen and Xie Chen},
  journal= {arXiv preprint arXiv:2508.06098},
  year   = {2025}
}