中文

TIT-Score:基于文本到图像到文本一致性评估长提示文本到图像对齐

计算机视觉与模式识别 2025-10-06 v1

摘要

随着大型多模态模型(LMM)的快速发展,最近的文本到图像(T2I)模型能够生成高质量图像并在短提示上表现出色。然而,他们仍然难以有效理解和遵循长篇详细提示,表现出不一致的生成。为此,我们引入LPG-Bench,这是一个用于评估长提示文本到图像生成综合基准。LPG-Bench包含200个精心构建的提示,平均长度超过250个单词,接近几款领先商业模型的输入容量。使用这些提示,我们从13个领先模型生成2600幅图像,并进行全面的人类排序标注。基于LPG-Bench,我们发现现有的文本到图像对齐评估指标在长提示文本到图像生成方面与人类偏好一致性差。为弥合这一差距,我们引入一种基于文本到图像到文本一致性的新型零样本指标,称为TIT,用于评估长提示生成的图像。TIT的核心概念是通过直接比较原始提示与LMM生成描述的一致性来量化T2I对齐,这包括一种高效的基于得分的实例化TIT-Score和一种基于大语言模型(LLM)的实例化TIT-Score-LLM。大量实验表明,我们的方法在人类判断方面优于CLIP-score、LMM-score等,TIT-Score-LLM相对于最强基准在双线性准确率上提升了7.31%。LPG-Bench和TIT方法共同为基准和推动T2I模型发展提供了更深入的视角。所有资源将公开提供。

关键词

引用

@article{arxiv.2510.02987,
  title  = {TIT-Score: Evaluating Long-Prompt Based Text-to-Image Alignment via Text-to-Image-to-Text Consistency},
  author = {Juntong Wang and Huiyu Duan and Jiarui Wang and Ziheng Jia and Guangtao Zhai and Xiongkuo Min},
  journal= {arXiv preprint arXiv:2510.02987},
  year   = {2025}
}