用于评估条件图像生成的统一代理框架
计算机视觉与模式识别
2025-04-10 v1 计算与语言
摘要
条件图像生成因其个性化内容能力而受到广泛关注。然而,该领域面临着开发任务无关、可靠且可解释评估指标的挑战。本文引入 CIGEval,一个用于全面评估条件图像生成任务的统一代理框架。CIGEval 利用大型多模态模型(LMM)作为核心,集成多功能工具箱并建立细粒度评估框架。此外,我们合成了用于微调的评估轨迹,使较小的 LMM 能够自主选择合适的工具并基于工具输出进行细致分析。跨七个著名条件图像生成任务的实验表明,CIGEval(GPT-4o 版本)与人类评估之间的相关系数高达 0.4625,接近人类评估者之间的相关系数 0.47。此外,在仅使用 2.3K 训练轨迹的情况下,CIGEval 采用 7B 开源 LMM 实现,超过了基于 GPT-4o 的前沿方法。GPT-4o 图像生成的案例研究表明,CIGEval 在识别主题一致性和控制指导遵从性方面存在细微问题的能力,凸显其在实现人类水平可靠性方面的巨大潜力。
引用
@article{arxiv.2504.07046,
title = {A Unified Agentic Framework for Evaluating Conditional Image Generation},
author = {Jifang Wang and Xue Yang and Longyue Wang and Zhenran Xu and Yiyu Wang and Yaowei Wang and Weihua Luo and Kaifu Zhang and Baotian Hu and Min Zhang},
journal= {arXiv preprint arXiv:2504.07046},
year = {2025}
}
备注
Work in progress. GitHub: https://github.com/HITsz-TMG/Agentic-CIGEval