保持或修改?面向文本引导图像编辑的上下文感知评估
计算机视觉与模式识别
2025-03-21 v3 人工智能
摘要
视觉语言和生成模型的发展显著推进了文本引导图像编辑,该方法旨在保留源图像的核心元素,同时根据目标文本实施修改。然而,现有指标存在上下文不敏感问题,对完全不同的源图像和目标文本对应用相同的评估标准,这导致偏向修改或保留。唯一考虑到源图像和目标文本的指标——方向性CLIP相似度——也偏向修改方面,并注意于图像的无关编辑区域。我们提出了 AugCLIP,一种根据特定源图像和目标文本上下文自适应协调保留和修改方面的上下文感知指标。这通过推导出理想编辑图像的CLIP表示来实现,该表示既保留源图像,又必要的修改以与目标文本一致。更具体地,AugCLIP 使用多模态大语言模型增强源和目标的文本描述,然后通过一个超平面计算修改向量,该超平面在CLIP空间中分离源和目标属性。在包含多样化编辑情景的五个基准数据集上的大量实验表明,AugCLIP 与人类评估标准高度吻合,超越了现有指标。代码可在 https://github.com/augclip/augclip_eval 获取。
引用
@article{arxiv.2410.11374,
title = {Preserve or Modify? Context-Aware Evaluation for Balancing Preservation and Modification in Text-Guided Image Editing},
author = {Yoonjeon Kim and Soohyun Ryu and Yeonsung Jung and Hyunkoo Lee and Joowon Kim and June Yong Yang and Jaeryong Hwang and Eunho Yang},
journal= {arXiv preprint arXiv:2410.11374},
year = {2025}
}
备注
accepted to CVPR 2025