分析与改进文本到图像扩散模型的快速采样
计算机视觉与模式识别
2026-03-03 v1
摘要
文本到图像扩散模型取得了前所未有的成功,但仍在受限采样预算下难以产生高质量结果。现有的训练-free 采样加速方法通常独立开发,导致这些方法在整体性能和相互兼容性方面未得到探索。本文通过系统性阐述设计空间,并通过全面实验确定采样时间计划是最关键的因素。灵感来自通过 Frenet-Serret 公式揭示的扩散模型几何属性,我们提出了恒定总旋转计划(TORS),这是一种确保沿采样轨迹几何变化均匀的调度策略。TORS 在 Flux.1-Dev 和 Stable Diffusion 3.5 上超过了之前的训练-free 加速方法,可在 10 次采样步骤下产生高质量图像。广泛的实验强调了该方法对未见模型、超参数和下游应用的适应性。
引用
@article{arxiv.2603.00763,
title = {Analyzing and Improving Fast Sampling of Text-to-Image Diffusion Models},
author = {Zhenyu Zhou and Defang Chen and Siwei Lyu and Chun Chen and Can Wang},
journal= {arXiv preprint arXiv:2603.00763},
year = {2026}
}