中文

$\texttt{Complex-Edit}$:面向复杂可控图像编辑基准的类似链式思考的指令生成

计算机视觉与模式识别 2025-04-18 v1 人工智能

摘要

我们提出Complex-Edit\texttt{Complex-Edit},一个全面的基准,旨在系统性地评估跨指令复杂度的指令式图像编辑模型。为开发此基准,我们利用GPT-4o自动大规模收集多样化的编辑指令。我们的做法遵循一个结构化的“链式编辑”(Chain-of-Edit)管道:首先独立生成单个原子编辑任务,然后将其整合以形成连贯的复杂指令。此外,我们引入了一套指标来评估各种编辑绩效,并构建了一个支持大规模评估的基于视觉语言模型(VLM)的自动评估管道。我们的基准得出若干重要发现:1)开源模型的表现显著落后于专有闭源模型,随指令复杂度的增加,性能差距进一步扩大;2)指令复杂度的增加主要损害模型保留输入图像关键要素的能力,并削弱整体审美质量的保持;3)将复杂指令分解为原子步骤的序列,按顺序执行,会在多个指标上显著降低性能;4)一种简单的“最佳-N选择”策略可改善直接编辑和逐步顺序方法的效果;5)我们观察到“合成数据诅咒”:当模型训练涉及合成数据时,随着编辑指令复杂度的提升,这些模型生成的编辑图像倾向于呈现越来越“合成”的特征——这一现象也同样出现在最新的GPT-4o输出中。

关键词

引用

@article{arxiv.2504.13143,
  title  = {$\texttt{Complex-Edit}$: CoT-Like Instruction Generation for Complexity-Controllable Image Editing Benchmark},
  author = {Siwei Yang and Mude Hui and Bingchen Zhao and Yuyin Zhou and Nataniel Ruiz and Cihang Xie},
  journal= {arXiv preprint arXiv:2504.13143},
  year   = {2025}
}

备注

Project Page: https://ucsc-vlaa.github.io/Complex-Edit/, Dataset: https://huggingface.co/datasets/UCSC-VLAA/Complex-Edit