中文

I2EBench:基于指令的图像编辑综合基准

计算机视觉与模式识别 2024-09-30 v2 人工智能

摘要

在基于指令的图像编辑(IIE)领域取得了显著的进展,但对这些模型的评估仍是一个重大挑战。在该领域中,建立一个全面的评估基准以准确评估编辑结果并为进一步发展提供有价值的见解是至关重要的。为此,我们提出I2EBench,这是一个全面的基准,旨在自动评估由IIE模型产生的编辑后图像的质量,并从多个维度提供见解。I2EBench包含2000多张用于编辑的图像,以及4000多组对应的原始图像和多样化指令。它具有三个独特特征:1)全面的评估维度:I2EBench包含16个评估维度,涵盖高层次和低层次方面,为每个IIE模型提供全面评估。2)人类感知对齐:为确保本基准与人类感知相匹配,我们为每个评估维度进行了大规模用户研究。3)有价值的研究见解:通过分析现有IIE模型在16个维度上的优势和不足,为指导该领域的未来发展提供了有价值的研究见解。我们将开源I2EBench,包括所有指令、输入图像、人工标注、来自所有评估方法的编辑后图像,以及用于评估新IIE模型结果的简单脚本。代码、数据集和来自所有IIE模型生成的图像均提供在github:https://github.com/cocoshe/I2EBench。

关键词

引用

@article{arxiv.2408.14180,
  title  = {I2EBench: A Comprehensive Benchmark for Instruction-based Image Editing},
  author = {Yiwei Ma and Jiayi Ji and Ke Ye and Weihuang Lin and Zhibin Wang and Yonghan Zheng and Qiang Zhou and Xiaoshuai Sun and Rongrong Ji},
  journal= {arXiv preprint arXiv:2408.14180},
  year   = {2024}
}

备注

NeurIPS2024, 15 pages, 7 figures