中文

文本到图像生成质量度量方法综述

计算机视觉与模式识别 2025-01-30 v5 人工智能 图形学

摘要

基于 AI 的文本到图像模型不仅擅长生成逼真的图像,还赋予设计师对图像内容越来越细粒度的控制。因此,这些方法在计算机图形学研究社区中受到了越来越多的关注,而该社区历来致力于提供对场景参数(例如,物体、材质和光照)精确控制的传统渲染技术。虽然传统渲染图像的质量通过成熟的图像质量度量方法(如 SSIM 或 PSNR)进行评估,但文本到图像生成的独特挑战需要其他专用的质量度量方法。这些度量方法不仅必须能够衡量整体图像质量,还要衡量图像反映给定文本提示的程度,其中场景与渲染参数的控制是相互交织的。在本综述中,我们对此类文本到图像质量度量方法进行了全面概述,并提出了一种对这些度量方法进行分类的分类法。我们的分类法基于这样一个假设:有两个主要质量标准,即构图质量与整体质量,共同构成整体图像质量。除了度量方法外,本综述还涵盖了常用于计算这些度量方法的专用文本到图像基准数据集。最后,我们指出了文本到图像生成领域的局限性与开放性挑战,并为进行文本到图像评估的从业者推导了指导原则。

关键词

引用

@article{arxiv.2403.11821,
  title  = {A Survey on Quality Metrics for Text-to-Image Generation},
  author = {Sebastian Hartwig and Dominik Engel and Leon Sick and Hannah Kniesel and Tristan Payer and Poonam Poonam and Michael Glöckler and Alex Bäuerle and Timo Ropinski},
  journal= {arXiv preprint arXiv:2403.11821},
  year   = {2025}
}

备注

preprint