中文

正确生成:提升文本到图像模型的空间一致性

计算机视觉与模式识别 2024-08-07 v2

摘要

当前文本到图像(T2I)模型的一个关键缺陷是它们无法一致地生成忠实遵循文本提示中指定空间关系的图像。在本文中,我们对这一局限性进行了全面研究,同时开发了支持T2I模型空间推理算法解决方案的数据集和方法。我们发现,当前视觉-语言数据集中的图像描述中空间关系代表性不足。为了缓解这一数据瓶颈,我们创建了SPRIGHT,这是第一个专注于空间的大规模数据集,通过对来自4个广泛使用的视觉数据集的600万张图像进行重新描述,并通过三轮评估和分析流程,表明SPRIGHT提高了现有数据集中空间关系的比例。我们通过展示仅使用约0.25%的SPRIGHT数据即可在生成空间准确图像方面提升22%,同时改善FID和CMMD分数,证明了SPRIGHT数据的有效性。我们还发现,在包含更多对象的图像上训练可以显著提升空间一致性,包括在T2I-CompBench上通过微调少于500张图像获得0.2133的空间分数,达到最先进水平。通过一组受控实验和消融研究,我们记录了额外的发现,这些发现可能支持未来旨在理解影响文本到图像模型空间一致性的因素的工作。

关键词

引用

@article{arxiv.2404.01197,
  title  = {Getting it Right: Improving Spatial Consistency in Text-to-Image Models},
  author = {Agneet Chatterjee and Gabriela Ben Melech Stan and Estelle Aflalo and Sayak Paul and Dhruba Ghosh and Tejas Gokhale and Ludwig Schmidt and Hannaneh Hajishirzi and Vasudev Lal and Chitta Baral and Yezhou Yang},
  journal= {arXiv preprint arXiv:2404.01197},
  year   = {2024}
}

备注

Accepted to ECCV 2024. Project Page : https://spright-t2i.github.io/