中文

CROC:用于伪标签和人类标签对比鲁棒性检查的 T2I 指标评估与训练

计算机视觉与模式识别 2026-04-21 v2 计算与语言

摘要

评估评估指标(meta-evaluation)对于确定现有指标在文本到图像(T2I)生成任务中的适用性至关重要。基于人类的 meta-evaluation 成本高昂且耗时,而自动化替代方案寥寥。我们填补了这一空白,提出 CROC:一个可扩展的用于自动对比鲁棒性检查(Contrastive Robustness Checks)的框架,通过系统性地综合测试和量化指标鲁棒性。借助 CROC,我们生成了包含超过 100 万个对比提示-图像对的伪标签数据集(CROCsyn^{syn}),以实现对评估指标的细粒度比较。我们还利用该数据集训练了 CROCScore,一个在开源方法中实现最先进性能的新指标,展示了该框架的另一个关键应用。为补充该数据集,我们引入了受人类监督的基准(CROChum^{hum}),针对尤其具挑战性的类别进行评估。我们的结果凸显了现有指标的鲁棒性问题:例如,许多指标在涉及否定词的提示上会失败,所有测试的开源指标在至少 24% 的情形下都无法正确识别身体部位。

关键词

引用

@article{arxiv.2505.11314,
  title  = {CROC: Evaluating and Training T2I Metrics with Pseudo- and Human-Labeled Contrastive Robustness Checks},
  author = {Christoph Leiter and Yuki M. Asano and Margret Keuper and Steffen Eger},
  journal= {arXiv preprint arXiv:2505.11314},
  year   = {2026}
}

备注

pre-MIT Press publication version; Accepted at TACL