中文

谁来评估评估指标?用T2IScoreScore (TS2)客观评分文生图提示一致性指标

计算机视觉与模式识别 2024-11-01 v3 人工智能 计算与语言

摘要

随着文生图(T2I)模型质量的提升,人们开始关注对其提示忠实度(即生成图像与所依赖提示的语义一致性)的基准测试。已有多种T2I忠实度指标被提出,利用了跨模态嵌入和视觉语言模型(VLM)的进展。然而,这些指标并未经过严格的比较和基准测试,而是通过在一组易于区分的图像上与人类Likert评分的相关性来呈现,且往往只与看似较弱的基线进行比较。我们引入了T2IScoreScore,这是一个精心策划的语义错误图集,包含一个提示和一组错误逐渐增多的图像。这使我们能够严格判断给定的提示忠实度指标是否能根据客观错误计数正确排序图像,并显著区分不同错误节点,使用基于既定统计检验的元指标分数。令人惊讶的是,我们发现测试的最先进的基于VLM的指标(例如TIFA、DSG、LLMScore、VIEScore)未能显著优于简单的(且被认为较差的)基于特征的指标如CLIPScore,尤其是在自然发生的T2I模型错误的困难子集上。TS2将通过更严格地比较其在客观标准下对预期排序和分离的符合程度,从而促进更好的T2I提示忠实度指标的开发。

关键词

引用

@article{arxiv.2404.04251,
  title  = {Who Evaluates the Evaluations? Objectively Scoring Text-to-Image Prompt Coherence Metrics with T2IScoreScore (TS2)},
  author = {Michael Saxon and Fatima Jahara and Mahsa Khoshnoodi and Yujie Lu and Aditya Sharma and William Yang Wang},
  journal= {arXiv preprint arXiv:2404.04251},
  year   = {2024}
}

备注

NeurIPS 2024 Spotlight