中文

EditInspector:文本引导图像编辑评估基准

计算机视觉与模式识别 2025-06-12 v1 人工智能 机器学习

摘要

文本引导图像编辑得益于近期生成AI的进展,正变得越来越普遍。这一趋势凸显了对全面框架来验证文本引导编辑并评估其质量的需求。为解决这一需求,我们引入了EditInspector,这是一个基于使用广泛模板收集的人工标注的文本引导图像编辑评估新基准。我们利用EditInspector评估最先进(SoTA)视觉和语言模型在多个维度上评估编辑的性能,包括准确性、伪影检测、视觉质量、与图像场景的无缝集成、常识遵循以及描述编辑引起变化的能力。我们的发现表明,当前模型在全面评估编辑方面存在困难,并且在描述变化时经常产生幻觉。为应对这些挑战,我们提出了两种新方法,在伪影检测和差异描述生成方面均优于最先进模型。

关键词

引用

@article{arxiv.2506.09988,
  title  = {EditInspector: A Benchmark for Evaluation of Text-Guided Image Edits},
  author = {Ron Yosef and Moran Yanuka and Yonatan Bitton and Dani Lischinski},
  journal= {arXiv preprint arXiv:2506.09988},
  year   = {2025}
}