A-Bench:大型多模态模型是否是评估AI生成图像的高手?
计算机视觉与模式识别
2025-02-10 v2 人工智能
摘要
如何准确且高效地评估AI生成图像(AI-generated Images, AIGIs)仍是一个关键挑战。鉴于用户研究的高成本和耗时,许多研究人员转向使用大型多模态模型(Large Multi-modal Models, LMMs)作为AIGI评估器,其精度和有效性仍存疑虑。此外,传统基准通常主要使用自然捕获的内容而非AIGIs来测试LMMs的能力,导致其对AIGIs存在显著的差距。因此,本文引入A-Bench,一个旨在诊断LMMs是否擅长评估AIGIs的基准。具体而言,A-Bench依据两个关键原则进行组织:1)强调高层语义理解和低层视觉质量感知,以应对AIGIs的复杂需求。2)采用多种生成模型创建AIGI,并使用多种LMMs进行评估,从而确保了全面的验证范围。最终,我们采样了来自16个文本到图像模型的2,864个AIGI,每个AIGI配有由人类专家标注的问答对,并在18个领先LMMs上进行测试。我们希望A-Bench能显著提升评估过程并促进AIGI的生成质量。该基准可在 https://github.com/Q-Future/A-Bench 上获得。
引用
@article{arxiv.2406.03070,
title = {A-Bench: Are LMMs Masters at Evaluating AI-generated Images?},
author = {Zicheng Zhang and Haoning Wu and Chunyi Li and Yingjie Zhou and Wei Sun and Xiongkuo Min and Zijian Chen and Xiaohong Liu and Weisi Lin and Guangtao Zhai},
journal= {arXiv preprint arXiv:2406.03070},
year = {2025}
}