使用 LLM 评估图像编辑:全面基准与中间层探测方法
计算机视觉与模式识别
2026-03-26 v2
摘要
评估文本导向图像编辑方法仍是一个具有挑战性的问题,因为可靠的评估应同时考虑感知质量、与文本指令的对齐程度以及对原始图像内容的保持。在快速进步的 TIE 模型方面,现有评估基准规模有限,常常显示出与人类感知判断之间的弱相关。本文引入 TIEdit,用于系统评估文本导向图像编辑方法的基准。TIEdit 包含 512 个源图像,配有跨八个代表性编辑任务的编辑提示,产生 5,120 张由十个最先进 TIE 模型生成的编辑后图像。为获得可靠的主观评分,邀请 20 位专家提供 307,200 条原始主观评分,汇总为 15,360 个平均意见分数(MOS),覆盖三个评估维度:感知质量、编辑对齐和内容保持。除了基准本身,我们进一步提出了 EditProbe,通过中间层探测来估计编辑质量的 LLM 评估器。EditProbe 从多模态大语言模型的中间层提取信息性表征,以更好地捕捉源图像、编辑指令和编辑结果之间的语义和感知关系。实验结果表明,广泛使用的自动评估指标在编辑任务上与人类判断之间的相关性有限,而 EditProbe 在与人类感知方面实现了显著更强的对齐。 TIEdit 和 EditProbe 为更可靠且感知上更贴合的文本导向图像编辑方法评估提供了基础。
引用
@article{arxiv.2603.19775,
title = {Evaluating Image Editing with LLMs: A Comprehensive Benchmark and Intermediate-Layer Probing Approach},
author = {Shiqi Gao and Zitong Xu and Kang Fu and Huiyu Duan and Xiongkuo Min and Jia wang},
journal= {arXiv preprint arXiv:2603.19775},
year = {2026}
}