GenEval 2:解决文本到图像评估中的基准漂移
计算机视觉与模式识别
2025-12-19 v1 人工智能
摘要
自动化文本到图像 (Text-to-Image, T2I) 模型评估具有挑战性;需要使用评判模型对正确性进行评分,并且必须选择具有挑战性的测试提示,以至于它们对当前 T2I 模型具有挑战性,但不对评判模型构成挑战。我们认为,这些约束可能导致基准漂移,其中静态基准评判模型无法跟上较新模型的能力。我们展示了基准漂移是 GenEval 这一最流行的 T2I 基准的一个重大问题。尽管 GenEval 在发布时与人类判断高度一致,但随着时间的推移,它已远离人类判断——导致当前模型的绝对误差高达 17.7%。这一水平的漂移强烈表明 GenEval 已过了一段时间被饱和,我们通过大规模人类研究进行了验证。为填补这一基准评估空白,我们引入了新的基准 GenEval 2,改进了对原始视觉概念的覆盖范围和更高的组合性,我们证明了它对当前模型更具挑战性。我们还引入了 Soft-TIFA,这是一种用于 GenEval 2 的评估方法,将视觉原语的判断相结合,我们证明它更符合人类判断,并认为它不太可能随时间漂离人类对齐(相较于诸如 VQAScore 等更整体的评判模型)。尽管我们希望 GenEval 2 将为许多年提供强大的基准,但避免基准漂移远非必然,而我们工作更广泛地表明,对于 T2I 和相关的自动化模型评估基准,持续审计和改进的重要性。
引用
@article{arxiv.2512.16853,
title = {GenEval 2: Addressing Benchmark Drift in Text-to-Image Evaluation},
author = {Amita Kamath and Kai-Wei Chang and Ranjay Krishna and Luke Zettlemoyer and Yushi Hu and Marjan Ghazvininejad},
journal= {arXiv preprint arXiv:2512.16853},
year = {2025}
}