面向多步骤扩散与流模型的一步生成模型的匹配设置与语义尺度基准测试
计算机视觉与模式识别
2026-05-11 v4
摘要
最先进的文本到图像模型会产生高质量图像,但推理成本高昂,因为生成需要多个连续的ODE或去噪步骤。原生一步模型旨在通过单步将噪声映射到图像以降低成本,但与多步骤系统的公平比较困难,因为研究使用的采样步数和不同的分类器自由指导(CFG)设置不匹配,其中CFG可能导致FID、Inception Score和CLIP-based对齐在相互方向上变化。也不清楚一步模型在多步骤推理中的扩展情况,以及Beyond ImageNet的标签-ID条件生成器的有限标准化分布外评估。为此,我们在ImageNet验证集、ImageNetV2和reLAIONet(我们新的与ImageNet标签ID对齐的新型证校分布外数据集)上,对八个模型(一步流(MeanFlow、Improved MeanFlow、SoFlow)、多步骤基线(RAE、Scale-RAE)以及 established 系统(SiT、Stable Diffusion 3.5、FLUX.1))进行基准测试。使用FID、Inception Score、CLIP Score和Pick Score,我们表明以FID为导向的模型开发和CFG选择在少数步骤 regime中可能误导性:指导变更可改善FID而降低文本-图像对齐和人类偏好信号,恶化视觉质量。为使这些tradeoffs显式,我们引入CLIP-scaled和PickScore-scaled的FID变体(csFID、psFID)和Inception Score变体(csIS、psIS),作为语义对齐图像生成的诊断工具。
引用
@article{arxiv.2603.14186,
title = {Setting-Matched and Semantics-Scaled Benchmarking of One-Step Generative Models Against Multistep Diffusion and Flow Models},
author = {Advaith Ravishankar and Serena Liu and Mingyang Wang and Todd Zhou and Jeffrey Zhou and Arnav Sharma and Ziling Hu and Léopold Das and Abdulaziz Sobirov and Faizaan Siddique and Freddy Yu and Seungjoo Baek and Yan Luo and Mengyu Wang},
journal= {arXiv preprint arXiv:2603.14186},
year = {2026}
}