中文

EdiVal-Agent:面向自动化、精细化多轮编辑评估的对象中心框架

计算机视觉与模式识别 2026-03-19 v3 人工智能 机器学习

摘要

基于指令的数值图像编辑取得了快速进展,但可靠且可解释的评估仍是瓶颈。当前的评估协议要么(i)依赖配对参考图像,导致覆盖范围有限并继承先前生成模型的偏见,要么(ii)仅依赖零-shot 视觉语言模型 (VLM),其基于提示的指令遵循、内容一致性和视觉质量评估常不够精确。为此,我们引入 EdiVal,一个基于对象中心视角的自动化精细化评估框架,旨在精确评估不仅限于标准单轮,也包括多轮指令数值的编辑。给定输入图像,EdiVal 首先将其分解为语义上有意义的对象,然后合成多样化、上下文感知的编辑指令,并在各轮中动态更新对象池。这两个阶段使我们能够针对多轮评估提出两个新颖的对象中心指标以及一个视觉质量的全局指标:1) EdiVal-IF,通过结合开放词汇对象检测器进行符号检查与 VLM 对检测器引导裁切进行语义验证来衡量指令遵循;2) EdiVal-CC 通过计算未更改对象和背景的语义相似度来评估内容一致性;3) EdiVal-VQ 使用人类偏好模型量化整体视觉质量变化。实例化此管道,我们构建 EdiVal Bench,一个覆盖 9 种指令类型和 16 种最先进编辑模型的多轮编辑基准,涵盖 in-context、flow-matching 和扩散范式。我们展示 EdiVal 可用于识别现有失效模式,从而为下一代编辑模型的开发提供指导。

关键词

引用

@article{arxiv.2509.13399,
  title  = {EdiVal-Agent: An Object-Centric Framework for Automated, Fine-Grained Evaluation of Multi-Turn Editing},
  author = {Tianyu Chen and Yasi Zhang and Zhi Zhang and Peiyu Yu and Shu Wang and Zhendong Wang and Kevin Lin and Xiaofei Wang and Zhengyuan Yang and Linjie Li and Chung-Ching Lin and Jianwen Xie and Oscar Leong and Lijuan Wang and Ying Nian Wu and Mingyuan Zhou},
  journal= {arXiv preprint arXiv:2509.13399},
  year   = {2026}
}

备注

Tianyu Chen and Yasi Zhang contributed equally; Oscar Leong, Lijuan Wang, Ying Nian Wu, and Mingyuan Zhou advised equally