常识T2I挑战:文本到图像生成模型是否理解常识?
计算机视觉与模式识别
2024-08-14 v2 人工智能
计算与语言
摘要
我们提出了一个新任务和基准,用于评估文本到图像(T2I)生成模型是否能生成符合现实生活中常识的图像,我们称之为Commonsense-T2I。给定包含相同一组行动词的对抗文本提示之间存在细微差别,如''a lightbulb without electricity'' v.s. ''a lightbulb with electricity'',我们评估T2I模型是否能够进行视觉常识推理,例如生成相应的''the lightbulb is unlit'' vs. ''the lightbulb is lit''的图像。Commonsense-T2I提供了一个对抗性挑战,提供成对的文本提示以及预期输出。该数据集由专家精心收集并标注了细粒度标签,如常识类型和预期输出的可能性,以帮助分析模型行为。我们对各种最先进(sota) T2I模型进行基准测试,惊讶地发现,即使是DALL-E 3模型也只能达到48.92%的准确率,stable diffusion XL模型也只有24.92%的准确率。我们的实验表明,GPT丰富化的提示无法解决这一挑战,我们包括关于这种不足原因的详细分析。我们希望Commonsense-T2I成为T2I常识检查的高质量评估基准,推动现实图像生成的进步。
引用
@article{arxiv.2406.07546,
title = {Commonsense-T2I Challenge: Can Text-to-Image Generation Models Understand Commonsense?},
author = {Xingyu Fu and Muyu He and Yujie Lu and William Yang Wang and Dan Roth},
journal= {arXiv preprint arXiv:2406.07546},
year = {2024}
}
备注
COLM 2024, Project Url: https://zeyofu.github.io/CommonsenseT2I/