TIIF-Bench:你的T2I模型如何遵循你的指令?
计算机视觉与模式识别
2025-06-26 v2
摘要
文本到图像(T2I)模型的快速发展开启了人工智能生成内容的新阶段,其标志是它们解释和遵循用户指令的能力不断增强。然而,现有的 T2I 模型评估基准在提示词的多样性和复杂性方面存在不足,且评估指标较为粗糙,难以评估文本指令与生成图像之间的细粒度对齐性能。在本文中,我们提出了 TIIF-Bench(文本到图像指令遵循基准),旨在系统地评估 T2I 模型解释和遵循复杂文本指令的能力。TIIF-Bench 包含一组按多个维度组织的 5000 个提示词,这些提示词被划分为三个难度和复杂性级别。为了严格评估模型对不同提示词长度的鲁棒性,我们为每个提示词提供了核心语义相同的短版本和长版本。我们引入了文本渲染和风格控制两个关键属性,以评估 T2I 模型的文本合成精度和美学连贯性。此外,我们收集了 100 个涵盖各种场景的高质量设计师级别提示词,以全面评估模型性能。利用大型视觉语言模型中编码的世界知识,我们提出了一种新颖的可计算框架,以辨别 T2I 模型输出中的细微变化。通过对主流 T2I 模型在 TIIF-Bench 上的细致基准测试,我们分析了当前 T2I 模型的优缺点,并揭示了当前 T2I 基准的局限性。项目页面:https://a113n-w3i.github.io/TIIF_Bench/。
引用
@article{arxiv.2506.02161,
title = {TIIF-Bench: How Does Your T2I Model Follow Your Instructions?},
author = {Xinyu Wei and Jinrui Zhang and Zeqing Wang and Hongyang Wei and Zhen Guo and Lei Zhang},
journal= {arXiv preprint arXiv:2506.02161},
year = {2025}
}
备注
23 pages, 12 figures, 11 tables