中文

使用 Gecko 重新审视文本到图像评估:指标、提示与人类评分

计算机视觉与模式识别 2025-03-18 v4

摘要

尽管文本到图像(T2I)生成模型已变得无处不在,但它们并不一定能生成与给定提示对齐的图像。尽管先前的工作通过提出指标、基准和收集人类判断的模板来评估 T2I 对齐度,但这些组件的质量并未得到系统性衡量。人工评分的提示集通常很小,且评分的可靠性——进而用于比较模型的提示集——也未被评估。我们通过开展一项广泛的研究来评估自动评估指标和人类模板,从而填补了这一空白。我们提供三项主要贡献:(1)我们引入了一个全面的基于技能的基准,能够区分不同人类模板下的模型。该基于技能的基准将提示分类为子技能,使从业者不仅能准确指出哪些技能具有挑战性,还能确定技能在何种复杂度水平上变得具有挑战性。(2)我们在四个模板和四个 T2I 模型上收集了人类评分,总计超过 10 万条标注。这使我们能够了解哪些差异源于提示中固有的歧义,哪些差异源于指标和模型质量的差异。(3)最后,我们引入了一种新的基于 QA 的自动评估指标,在我们的新数据集上、不同的人类模板下以及在 TIFA160 上,它与人类评分的相关性均优于现有指标。

关键词

引用

@article{arxiv.2404.16820,
  title  = {Revisiting Text-to-Image Evaluation with Gecko: On Metrics, Prompts, and Human Ratings},
  author = {Olivia Wiles and Chuhan Zhang and Isabela Albuquerque and Ivana Kajić and Su Wang and Emanuele Bugliarello and Yasumasa Onoe and Pinelopi Papalampidi and Ira Ktena and Chris Knutsen and Cyrus Rashtchian and Anant Nawalgaria and Jordi Pont-Tuset and Aida Nematzadeh},
  journal= {arXiv preprint arXiv:2404.16820},
  year   = {2025}
}

备注

Accepted to ICLR 2025 (Spotlight)