EditCLIP:面向图像编辑的表示学习
计算机视觉与模式识别
2025-03-27 v1
摘要
我们引入了EditCLIP,一种新颖的面向图像编辑的表示学习方法。我们的方法通过联合编码输入图像及其编辑后的对应图像,学习编辑的统一表示,有效捕捉它们的变换。为了评估其有效性,我们使用EditCLIP解决两个任务:基于示例的图像编辑和自动编辑评估。在基于示例的图像编辑中,我们用从参考示例图像对计算出的EditCLIP嵌入替换InstructPix2Pix中的基于文本的指令。实验表明,我们的方法优于最先进的方法,同时更高效且更通用。对于自动评估,EditCLIP通过测量给定图像对的EditCLIP嵌入与文本编辑指令或另一个参考图像对的EditCLIP嵌入之间的相似性来评估图像编辑。实验表明,EditCLIP比现有的基于CLIP的指标更符合人类判断,为编辑质量和结构保持提供了可靠的度量。
引用
@article{arxiv.2503.20318,
title = {EditCLIP: Representation Learning for Image Editing},
author = {Qian Wang and Aleksandar Cvejic and Abdelrahman Eldesokey and Peter Wonka},
journal= {arXiv preprint arXiv:2503.20318},
year = {2025}
}
备注
Project page: https://qianwangx.github.io/EditCLIP/