中文

评估文本和图像生成模型中空间关系的生成

计算机视觉与模式识别 2024-11-13 v1

摘要

理解空间关系是人类和 AI 共同的关键认知能力。尽管当前研究主要集中在文本到图像(T2I)模型的基准测试上,但我们提出了一种更全面的评估,同时包含 T2I 模型和大语言模型(LLM)。由于空间关系天然以视觉空间方式理解,我们开发了一种将 LLM 输出转换为图像的方法,从而能够以视觉方式评估 T2I 模型和 LLM。我们在 10 个常见介词上考察了 8 个知名生成模型(3 个 T2I 模型和 5 个 LLM)的空间关系理解,并评估了自动评估方法的可行性。令人惊讶的是,尽管 T2I 模型具有令人印象深刻的通用图像生成能力,但其在空间关系生成上仅达到次优表现。更令人惊讶的是,我们的结果表明,尽管 LLM 主要在文本数据上训练,但在生成空间关系方面却比 T2I 模型显著更准确。我们分析了模型失败的原因,并指出了可填补的差距,以实现更忠实的空间生成。

关键词

引用

@article{arxiv.2411.07664,
  title  = {Evaluating the Generation of Spatial Relations in Text and Image Generative Models},
  author = {Shang Hong Sim and Clarence Lee and Alvin Tan and Cheston Tan},
  journal= {arXiv preprint arXiv:2411.07664},
  year   = {2024}
}