FlashEdit: 解耦速度、结构与语义以实现精确图像编辑
计算机视觉与模式识别
2026-05-19 v6
摘要
基于扩散模型的文本引导图像编辑已取得显著质量,但通常遭受 prohibitive 延迟。我们引入了 \textbf{FlashEdit},一个用于标准反转编辑设置的实时局部图像编辑框架。其效率和精度源于三个关键创新:(1) 一个\textbf{循环一致单步反转(COSI)}流水线,通过循环一致性鼓励流形对齐的单步反转;(2) 一个\textbf{背景屏蔽(BG-Shield)}技术,通过结构自注意力干预改善非编辑区域的保留;(3) 一个\textbf{稀疏空间交叉注意力(SSCA)}机制,通过抑制语义泄漏来促进精确编辑。在 PIE-Bench 上的实验展示了强大的保留-效率权衡,编辑在 0.2 秒内完成,相比 DDIM 多步编辑实现了超过 150 的加速。我们的代码将在 \url{https://github.com/JunyiWuCode/FlashEdit} 公开。
引用
@article{arxiv.2509.22244,
title = {FlashEdit: Decoupling Speed, Structure, and Semantics for Precise Image Editing},
author = {Junyi Wu and Zhiteng Li and Haotong Qin and Yulun Zhang and Xiaokang Yang},
journal= {arXiv preprint arXiv:2509.22244},
year = {2026}
}
备注
Our code will be made publicly available at https://github.com/JunyiWuCode/FlashEdit