SenseFlow:面向基于流的文本到图像蒸馏的分布匹配缩放
计算机视觉与模式识别
2026-03-03 v2
摘要
分布匹配蒸馏(DMD)已成功应用于诸如 Stable Diffusion (SD) 1.5 等文本到图像扩散模型。然而,原始 DMD 在大规模基于流的文本到图像模型(如 SD 3.5 和 FLUX)上面临收敛困难。在本文中,我们首先分析了在大规模模型上应用原始 DMD 时的问题。然后,为了克服可扩展性挑战,我们提出了隐式分布对齐(IDA)以约束生成器与伪造分布之间的散度。此外,我们提出了片段内引导(ISG),以从教师模型中重新分配时间步去噪重要性。仅使用 IDA,DMD 即可在 SD 3.5 上收敛;同时采用 IDA 和 ISG,DMD 可在 SD 3.5 和 FLUX.1 dev 上收敛。结合缩放的基于 VFM 的判别器,我们的最终模型命名为 SenseFlow,在基于扩散的文本到图像模型(如 SDXL)和基于流匹配的模型(如 SD 3.5 Large 和 FLUX.1 dev)的蒸馏中均取得了卓越的性能。源代码可在 https://github.com/XingtongGe/SenseFlow 获取。
引用
@article{arxiv.2506.00523,
title = {SenseFlow: Scaling Distribution Matching for Flow-based Text-to-Image Distillation},
author = {Xingtong Ge and Xin Zhang and Tongda Xu and Yi Zhang and Xinjie Zhang and Yan Wang and Jun Zhang},
journal= {arXiv preprint arXiv:2506.00523},
year = {2026}
}
备注
Published as a conference paper at ICLR 2026