LMM4Edit:基于 LMM 的多模态图像编辑基准与评估
计算机视觉与模式识别
2025-09-09 v2 多媒体
摘要
文本引导图像编辑(TIE)的快速发展使得通过文本提示修改图像成为可能。然而,当前的 TIE 模型仍难以在图像质量、编辑对齐以及与原图的一致性之间取得平衡,限制了其实际应用。现有的 TIE 评估基准和指标在规模或与人类感知的对齐方面存在局限性。为此,我们引入了 EBench-18K,这是首个包含 18K 带有细粒度人类偏好标注的编辑图像的大规模图像编辑基准,用于评估 TIE。具体而言,EBench-18K 包含 1,080 张源图像及其对应的跨 21 个任务的编辑提示、由 17 个 SOTA TIE 模型生成的 18K+ 张编辑图像、从三个评估维度评定的 55K+ 平均主观评分(MOSs),以及 18K+ 问答(QA)对。基于 EBench-18K,我们利用出色的 LMM 对编辑图像进行评估,同时评估结果反过来为了解 LMM 的理解能力与人类偏好之间的对齐程度提供了洞见。然后,我们提出了 LMM4Edit,这是一种基于 LMM 的指标,以一体化方式从感知质量、编辑对齐、属性保留和特定任务 QA 准确率四个方面评估图像编辑模型。大量实验表明,LMM4Edit 取得了出色的性能,并与人类偏好高度对齐。在其他数据集上的零样本验证也展示了我们模型的泛化能力。数据集和代码可在 https://github.com/IntMeGroup/LMM4Edit 获取。
引用
@article{arxiv.2507.16193,
title = {LMM4Edit: Benchmarking and Evaluating Multimodal Image Editing with LMMs},
author = {Zitong Xu and Huiyu Duan and Bingnan Liu and Guangji Ma and Jiarui Wang and Liu Yang and Shiqi Gao and Xiaoyu Wang and Jia Wang and Xiongkuo Min and Guangtao Zhai and Weisi Lin},
journal= {arXiv preprint arXiv:2507.16193},
year = {2025}
}