中文

ICEdit:基于大规模扩散变换器的上下文指令图像编辑

计算机视觉与模式识别 2025-09-24 v3

摘要

基于指令的图像编辑通过自然语言提示实现精确修改,但现有方法面临精度与效率之间的权衡:微调需要大量数据集(>1000 万)和计算资源,而无训练方法则难以理解指令。我们通过提出 ICEdit 来解决此问题,利用大规模扩散变换器(DiT)内置的理解与生成能力,实现三项关键创新:(1)无需架构修改的上下文编辑范式;(2)用于质量提升的最小参数高效微调;(3)基于 VLMs 的早期过滤推理时间扩展,以选择高质量噪声样本提升效率。实验表明,ICEdit 仅需相较于先前方法的 0.1% 训练数据和 1% 可训练参数,即可实现最先进的编辑性能。我们的做法为在指令图像编辑中平衡精度与效率建立了新范式。代码与演示可在 https://river-zhang.github.io/ICEdit-gh-pages/ 查看。

关键词

引用

@article{arxiv.2504.20690,
  title  = {In-Context Edit: Enabling Instructional Image Editing with In-Context Generation in Large Scale Diffusion Transformer},
  author = {Zechuan Zhang and Ji Xie and Yu Lu and Zongxin Yang and Yi Yang},
  journal= {arXiv preprint arXiv:2504.20690},
  year   = {2025}
}

备注

Accepted by NeurIPS 2025, there will be future updates for camera ready version. Code: https://github.com/River-Zhang/ICEdit