中文

TIAM——一种用于评估文本到图像生成对齐程度的指标

计算机视觉与模式识别 2024-01-04 v2 人工智能 计算与语言 机器学习

摘要

合成图像生成方面的进展使得评估其质量变得至关重要。虽然已提出若干指标来评估图像的渲染效果,但对于基于提示生成图像的文本到图像(T2I)模型而言,考虑额外方面(例如生成图像在多大程度上匹配提示中的重要内容)是关键的。此外,尽管生成的图像通常源于随机起点,但该起点的影响一般未被考虑。在本文中,我们提出一种基于提示模板的新指标,用于研究提示中指定的内容与相应生成图像之间的对齐程度。它使我们能够根据指定对象的类型、数量及其颜色更好地刻画对齐情况。我们对若干近期 T2I 模型在不同方面进行了研究。我们的方法得出的一个额外有趣结果是,图像质量可能随用作图像种子的噪声不同而发生剧烈变化。我们还量化了提示中概念数量、顺序及其(颜色)属性的影响。最后,我们的方法使我们能够识别出一些比其他种子产生更好图像的种子,从而为这一研究不足的主题开辟了新的研究方向。

关键词

引用

@article{arxiv.2307.05134,
  title  = {TIAM -- A Metric for Evaluating Alignment in Text-to-Image Generation},
  author = {Paul Grimal and Hervé Le Borgne and Olivier Ferret and Julien Tourille},
  journal= {arXiv preprint arXiv:2307.05134},
  year   = {2024}
}