UniGenBench++:面向文本到图像生成的统一语义评估基准
计算机视觉与模式识别
2026-02-25 v2
摘要
文本到图像(T2I)生成的最新进展凸显了可靠基准在评估生成图像准确反映文本提示语义方面的重要性。然而,(1)现有基准缺乏提示场景的多样性和多语言支持,而这两者对于实际应用都至关重要;(2)它们仅提供跨主要维度的粗略评估,覆盖的子维度范围狭窄,并且在细粒度子维度评估方面存在不足。为解决这些局限性,我们引入了UniGenBench++,一个用于T2I生成的统一语义评估基准。具体而言,它包含600个按层次结构组织的提示,以确保覆盖范围和效率:(1)涵盖多样化的真实世界场景,即5个主要提示主题和20个子主题;(2)全面探测T2I模型在10个主要评估标准和27个子评估标准上的语义一致性,每个提示评估多个测试点。为严格评估模型对语言和提示长度变化的鲁棒性,我们提供了每个提示的英文和中文版本,各有短格式和长格式。利用闭源多模态大语言模型(MLLM),即Gemini-2.5-Pro,的通用世界知识和细粒度图像理解能力,我们开发了一个有效的流水线,用于可靠的基准构建和简化的模型评估。此外,为进一步方便社区使用,我们训练了一个稳健的评估模型,能够对T2I模型输出进行离线评估。通过对开源和闭源T2I模型的全面基准测试,我们系统地揭示了它们在不同方面的优势和劣势。
引用
@article{arxiv.2510.18701,
title = {UniGenBench++: A Unified Semantic Evaluation Benchmark for Text-to-Image Generation},
author = {Yibin Wang and Zhimin Li and Yuhang Zang and Jiazi Bu and Yujie Zhou and Yi Xin and Junjun He and Chunyu Wang and Qinglin Lu and Cheng Jin and Jiaqi Wang},
journal= {arXiv preprint arXiv:2510.18701},
year = {2026}
}
备注
Project page: codegoat24.github.io/UniGenBench/