中文

T2I-FactualBench:基于知识密集型概念评估文本到图像模型事实性的基准测试

计算机视觉与模式识别 2026-04-20 v3 人工智能

摘要

评估合成图像的质量仍然是文本到图像(T2I)生成发展中的一个重大挑战。该领域的大多数现有研究主要聚焦于评估文本-图像对齐、图像质量和对象组合能力,而 comparatively fewer studies 涉及评估T2I模型的事实性,特别是当涉及的概念是知识密集型时。为弥补这一差距,我们在本文中提出了T2I-FactualBench——迄今为止在知识密集型概念和提示数量方面规模最大的基准测试,专门设计用于评估知识密集型概念生成的事实性。T2I-FactualBench由一个三层知识密集型文本到图像生成框架组成,涵盖从单个知识概念的基本记忆到多个知识概念的更复杂组合。我们进一步引入了一个基于多轮视觉问答(VQA)的评估框架,用于评估三层知识密集型文本到图像生成任务的事实性。在T2I-FactualBench上的实验表明,当前最先进的(SOTA)T2I模型仍有显著改进空间。

关键词

引用

@article{arxiv.2412.04300,
  title  = {T2I-FactualBench: Benchmarking the Factuality of Text-to-Image Models with Knowledge-Intensive Concepts},
  author = {Ziwei Huang and Wanggui He and Quanyu Long and Yandi Wang and Haoyuan Li and Zhelun Yu and Fangxun Shu and Long Chan and Hao Jiang and Fei Wu and Leilei Gan},
  journal= {arXiv preprint arXiv:2412.04300},
  year   = {2026}
}