面向评估文本到图像模型提示遵循鲁棒性的研究
计算机视觉与模式识别
2025-07-14 v1 人工智能
机器学习
摘要
近年来,大型语言模型(LLM)的快速发展惊人地改变了人们对其能力和多样化应用的认识。这些潜在的实际应用场景促使大量研究聚焦于其可靠性和有效性。另一方面,多模态LLM和文本到图像模型仅近期才引起广泛关注,尤其是与文本-only LLM相比。其可靠性受限于对其性能和鲁棒性评估的研究不足。本文旨在建立一个全面的评估框架,用于评估文本到图像模型,尤其关注其对提示的遵循程度。我们创建了一个新数据集,旨在评估这些模型在生成符合输入文本提示中指定变体因素的图像方面的鲁棒性。我们的评估研究在三个Stable Diffusion模型变体方面取得了发现:Stable Diffusion 3 Medium、Stable Diffusion 3.5 Large和Stable Diffusion 3.5 Large Turbo,以及两个Janus模型变体:Janus Pro 1B和Janus Pro 7B。我们引入了一个管道,利用来自gpt-4o模型生成的文本描述作为参考图像,然后将这些描述传递给文本到图像模型以生成人工图像。我们随后通过相同的系统提示将这些生成的图像再次传递给gpt-4o,并比较两种描述之间的差异。我们的结果显示,这些模型在创建仅包含两种简单二元因素(简单几何形状及其位置)的图像方面仍然吃力。我们还展示了使用在我们数据集上预训练的VAEs,这些模型无法遵循输入数据集分布来生成图像。
引用
@article{arxiv.2507.08039,
title = {Towards Evaluating Robustness of Prompt Adherence in Text to Image Models},
author = {Sujith Vemishetty and Advitiya Arora and Anupama Sharma},
journal= {arXiv preprint arXiv:2507.08039},
year = {2025}
}