面向指令引导图像编辑评估的自动数据集创建与评分器
计算机视觉与模式识别
2025-07-29 v2
摘要
最近的指令引导图像编辑进展凸显了有效自动评估的需求。虽然已探索将视觉语言模型(VLM)作为评判员,但开源模型在对齐方面困难,专有模型则缺乏透明度和成本效率。此外,目前没有公开训练数据集可用于微调开源VLM,只有小型基准测试包含多样化的评估方案。为此,我们引入ADIEE(Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation),即一种自动数据集创建方法,然后用于训练图像编辑评估的评分模型。我们生成了包含10余万个样本的大规模数据集,并用于微调经过修改的LLaVA-NeXT-8B模型,该模型被修改以解码来自自定义标记的数值分数。 resulting scorer 在所有基准测试中均超越了所有开源VLM和Gemini-Pro 1.5,实现了在AURORA-Bench上与人类评分相关性得分提升0.0696(+17.24%),在GenAI-Bench和AURORA-Bench上的两两比较准确率分别提升4.03%(+7.21%)和4.75%(+9.35%),超过最先进的水平。该评分器可作为奖励模型,用于自动选择最佳编辑并微调模型。值得注意的是,所提出的评分器可将MagicBrush模型在ImagenHub上的平均评估分数从5.90提升至6.43(+8.98%)。我们的代码和模型已在https://github.com/SherryXTChen/ADIEE.git上提供。
引用
@article{arxiv.2507.07317,
title = {ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation},
author = {Sherry X. Chen and Yi Wei and Luowei Zhou and Suren Kumar},
journal= {arXiv preprint arXiv:2507.07317},
year = {2025}
}
备注
International Conference on Computer Vision (ICCV) 2025