中文

发生了什么变化?基于多模态大语言模型检测与评估指令引导的图像编辑

计算机视觉与模式识别 2025-05-28 v1 人工智能 计算与语言 多媒体

摘要

基于指令的图像编辑模型在生成任务中提供了更多的个性化机会。然而,正确评估其结果具有挑战性,且现有大多数指标在与人类判断的对齐度和可解释性方面存在滞后。为了解决这些问题,我们引入了 DICE(DIfference Coherence Estimator,差异连贯性估计器),这是一种旨在检测原始图像与编辑图像之间局部差异,并评估其与给定修改请求相关性的模型。DICE 由两个关键组件构成:差异检测器和连贯性估计器,两者均构建于自回归多模态大语言模型(MLLM)之上,并结合了利用自监督、来自图像修复网络的蒸馏以及全监督的训练策略进行训练。通过广泛的实验,我们评估了流程的各个阶段,并在所提框架内比较了不同的 MLLM。我们证明 DICE 能够有效识别连贯的编辑,通过评估不同编辑模型生成的图像,展现出与人类判断的强相关性。我们公开发布了源代码、模型和数据。

关键词

引用

@article{arxiv.2505.20405,
  title  = {What Changed? Detecting and Evaluating Instruction-Guided Image Edits with Multimodal Large Language Models},
  author = {Lorenzo Baraldi and Davide Bucciarelli and Federico Betti and Marcella Cornia and Lorenzo Baraldi and Nicu Sebe and Rita Cucchiara},
  journal= {arXiv preprint arXiv:2505.20405},
  year   = {2025}
}