中文

EditCLIP:面向图像编辑的表示学习

计算机视觉与模式识别 2025-03-27 v1

摘要

我们引入了EditCLIP,一种新颖的面向图像编辑的表示学习方法。我们的方法通过联合编码输入图像及其编辑后的对应图像,学习编辑的统一表示,有效捕捉它们的变换。为了评估其有效性,我们使用EditCLIP解决两个任务:基于示例的图像编辑和自动编辑评估。在基于示例的图像编辑中,我们用从参考示例图像对计算出的EditCLIP嵌入替换InstructPix2Pix中的基于文本的指令。实验表明,我们的方法优于最先进的方法,同时更高效且更通用。对于自动评估,EditCLIP通过测量给定图像对的EditCLIP嵌入与文本编辑指令或另一个参考图像对的EditCLIP嵌入之间的相似性来评估图像编辑。实验表明,EditCLIP比现有的基于CLIP的指标更符合人类判断,为编辑质量和结构保持提供了可靠的度量。

关键词

引用

@article{arxiv.2503.20318,
  title  = {EditCLIP: Representation Learning for Image Editing},
  author = {Qian Wang and Aleksandar Cvejic and Abdelrahman Eldesokey and Peter Wonka},
  journal= {arXiv preprint arXiv:2503.20318},
  year   = {2025}
}

备注

Project page: https://qianwangx.github.io/EditCLIP/