中文

什么造就了一个好的度量?评估文本-图像一致性的自动度量

计算与语言 2024-12-19 v1

摘要

语言模型越来越多地被作为组件集成到更大的AI系统中,用于从提示优化到自动评估的各种目的。在本工作中,我们分析了四种近期常用的测量文本-图像一致性的方法——CLIPScore、TIFA、VPEval和DSG——的构念效度,这些方法依赖于语言模型和/或VQA模型作为组件。我们将文本-图像一致性度量的构念效度定义为一组文本-图像一致性度量应具备的期望属性,并发现没有测试的度量满足所有属性。我们发现度量缺乏对语言和视觉属性的足够敏感性。其次,我们发现TIFA、VPEval和DSG提供了超越CLIPScore的新信息,但它们之间也高度相关。我们还消融了文本-图像一致性度量的不同方面,发现并非所有模型组件都是严格必要的,这也是对视觉信息敏感性不足的症状。最后,我们表明所有三个基于VQA的度量可能依赖于熟悉的文本捷径(如问答中的“是”偏差),这使它们作为模型性能定量评估的适用性受到质疑。

关键词

引用

@article{arxiv.2412.13989,
  title  = {What makes a good metric? Evaluating automatic metrics for text-to-image consistency},
  author = {Candace Ross and Melissa Hall and Adriana Romero Soriano and Adina Williams},
  journal= {arXiv preprint arXiv:2412.13989},
  year   = {2024}
}

备注

Accepted and presented at COLM 2024