中文

Diffusion Transformer 中的选择性区域编辑:SpotEdit

计算机视觉与模式识别 2025-12-30 v1 人工智能

摘要

Diffusion Transformer 模型在图像编辑中取得了显著进步,通过对条件图像进行编码并将其集成到 transformer 层中。然而,大多数编辑只修改小区域,而当前方法在每个时间步对所有 token 进行统一的处理和去噪,导致计算冗余,可能降低未改变区域的质量。这引出一个根本问题:在编辑期间,是否真的需要重新生成每个区域?为此,我们提出了 SpotEdit,一个无需训练的 diffusion 编辑框架,以选择性更新仅修改的区域。SpotEdit 包含两个关键组件:SpotSelector 通过感知相似性识别稳定区域并通过重复条件图像特征来跳过其计算;SpotFusion 通过动态融合机制自适应地将这些特征与编辑 token 混合,保持上下文连贯性和编辑质量。通过减少不必要的计算并保持未修改区域的高保真度,SpotEdit 实现了高效且精确的图像编辑。

关键词

引用

@article{arxiv.2512.22323,
  title  = {SpotEdit: Selective Region Editing in Diffusion Transformers},
  author = {Zhibin Qin and Zhenxiong Tan and Zeqing Wang and Songhua Liu and Xinchao Wang},
  journal= {arXiv preprint arXiv:2512.22323},
  year   = {2025}
}

备注

14 pages, 8 figures