面向扩散转换器的训练-free 多分辨率潜在上采样:实现空间加速
计算机视觉与模式识别
2026-02-26 v3 图像与视频处理
摘要
扩散转换器(DiTs)在高保真生成方面表现优异,但其计算开销在实际部署方面构成重大挑战。现有加速方法主要利用时间维度,而空间加速仍受到忽视。本文通过潜在上采样探索DiTs的空间加速。我们发现,针对空间加速进行的朴素潜在上采样会引入伪影,主要源于高频边缘区域的混叠及噪声-时间步差异导致的不匹配。基于上述发现与分析,我们提出一种训练-free 空间加速框架,称为区域自适应潜在上采样(RALU),以消除伪影的同时实现DiTs的空间加速。RALU通过仅对易产生伪影的边缘区域进行早期上采样,以及针对不同潜在分辨率进行噪声-时间步匹配,实现无伪影、高效的加速,相较于FLUX-1.dev实现最高达7.0倍加速,Stable Diffusion 3实现3.0倍加速,质量损耗可忽略不计。此外,RALU可与现有时间加速方法及时间步蒸馏模型互补,实现最高达15.9倍的加速。
引用
@article{arxiv.2507.08422,
title = {Training-free Mixed-Resolution Latent Upsampling for Spatially Accelerated Diffusion Transformers},
author = {Wongi Jeong and Kyungryeol Lee and Hoigi Seo and Se Young Chun},
journal= {arXiv preprint arXiv:2507.08422},
year = {2026}
}