基于条件偏移的自对抗一步生成
计算机视觉与模式识别
2026-04-15 v1
摘要
推动文本到图像合成高效化的趋势使该领域朝着一步采样发展,但现有方法仍面临保真度、推理速度和训练效率之间的三方面权衡。依赖外部判别器的方法虽能提升一步生成性能,但常引入训练不稳定、高GPU内存开销和收敛缓慢的问题, complicating scaling and parameter efficient tuning。相比之下,基于回归的蒸馏和一致性目标更易优化,但通常受限于单一步骤,导致细节丢失。我们提出的APEX基于一个关键理论洞察:通过条件偏移从流模型中提取对抗性校正信号。通过一种变换创建移位条件分支,其速度场作为模型当前生成分布的独立估计器,从而产生一个可证明符合GAN对齐的梯度,取代导致梯度消失的样本相关判别器项。该无判别器设计保持网络结构不变,使APEX成为兼容全参数和LoRA微调的即插即用框架。经验上,我们的0.6B模型在一步生成质量上超越了FLUX-Schnell 12B(参数数额是其20倍)。在Qwen-Image 20B上进行LoRA微调时,APEX在NFE=1时达到GenEval 0.89分,在6小时内超越了原始50步教师(0.87),并提供了15.33倍的推理加速。代码已公开 https://github.com/LINs-lab/APEX。
引用
@article{arxiv.2604.12322,
title = {Self-Adversarial One Step Generation via Condition Shifting},
author = {Deyuan Liu and Peng Sun and Yansen Han and Zhenglin Cheng and Chuyan Chen and Tao Lin},
journal= {arXiv preprint arXiv:2604.12322},
year = {2026}
}