SpecEdit:基于语义锁定的基于扩散的图像编辑训练-free 加速
计算机视觉与模式识别
2026-05-05 v1
摘要
基于扩散的数值图像编辑提供强大的语义可控性,但由于在所有空间 token 上进行迭代高分辨率去噪,计算开销仍较大。动态分辨率采样通过在降低分辨率下进行早期步骤来降低此开销。然而,现有方法优先使用边缘检测或通道方差等低层启发式方法进行上采样,这些方法与编辑语义关联较弱,可能导致结构不一致。此外,空间区域往往在未验证是否实际需要语义修改的情况下进行上采样,导致冗余的高分辨率计算和累积误差。因此,我们提出了 SpecEdit,一个为基于扩散的数值图像编辑量身定制的训练-free 动态分辨率框架。SpecEdit 遵循草稿-验证方案:首先在低分辨率下进行草稿,估计语义结果,然后利用 token 级别的差异识别出需要进行高分辨率去噪的编辑相关 token,而其余 token 保持粗糙分辨率。在 Qwen-Image-Edit 和 FLUX.1-Kontext-dev 上的实验表明,分别实现了最高可达 10 倍和 7 倍的加速,同时保持优异的质量。SpecEdit 可与 step distillation 等其他加速技术相结合,实现最高可达 13 倍的加速。我们的代码已在补充材料中提供,并将在 GitHub 上发布。
引用
@article{arxiv.2605.02152,
title = {SpecEdit: Training-Free Acceleration for Diffusion based Image Editing via Semantic Locking},
author = {Zhengan Yan and Shikang Zheng and Haoran Qin and Xiaobing Tu and Yinggui Wang and Jiacheng Liu and Jiaxuan Ren and Yuqi Lin and Peiliang Cai and Jinkui Ren and Xiantao Zhang and Linfeng Zhang},
journal= {arXiv preprint arXiv:2605.02152},
year = {2026}
}
备注
Main paper with supplementary material; figures and tables included