Flow2GAN:基于多分辨率网络的混合流匹配与GAN用于少步高保真音频生成
音频与语音处理
2026-03-10 v2
摘要
现有音频生成主导方法包括生成对抗网络(GAN)和基于扩散的方法,如流匹配(Flow Matching)。GAN在训练过程中 suffer 从慢收敛,而扩散方法需要多步推理,导致计算开销较大。本文引入Flow2GAN,一个两阶段框架,将流匹配训练用于学习生成能力,结合GAN微调实现高效少步推理。具体而言,鉴于音频的独特特性,我们通过以下方式改进流匹配以用于音频建模:1)将目标重新表述为端点估计,避免涉及空区域时的速度估计困难;2)应用谱能基于损失缩放,以强调感知上较小的 quieter 区域。基于这些流匹配改进,我们展示,通过轻量级GAN微调可获得少步(例如1/2/4步)生成器,能够产生高质量音频。此外,我们开发了多分支网络架构,用于处理不同时频分辨率的傅里叶系数,相较于先前单分辨率设计,提升了建模能力。实验结果表明,Flow2GAN能够从Mel频谱图或离散音频标记生成高保真音频,在质量-效率权衡方面优于现有SOTA的GAN-based和Flow Matching-based方法。线上演示样本可在 https://flow2gan.github.io 获取,源码已发布于 https://github.com/k2-fsa/Flow2GAN。
引用
@article{arxiv.2512.23278,
title = {Flow2GAN: Hybrid Flow Matching and GAN with Multi-Resolution Network for Few-step High-Fidelity Audio Generation},
author = {Zengwei Yao and Wei Kang and Han Zhu and Liyong Guo and Lingxuan Ye and Fangjun Kuang and Weiji Zhuang and Zhaoqing Li and Zhifeng Han and Long Lin and Daniel Povey},
journal= {arXiv preprint arXiv:2512.23278},
year = {2026}
}
备注
Published as a conference paper at ICLR 2026