图像-文本指标是否尊重语义不变性?
计算机视觉与模式识别
2026-05-26 v1
摘要
参考自由的图像-文本评估器已成为评估图像-标题对齐的标准工具,但是否尊重语义不变性尚不明确。我们对五大流行评估器(CLIPScore、PAC-S、UMIC、FLEUR 和一个确定性 LLM 评判器)进行了不变性探针测试,这些评估器在三个轴向上的语义保持扰动下进行测试——空间(翻转、上下文保持的重新定位、轻微旋转)、对象(尺度、类别)以及社会语言化描述(带中性控制的文化/经济形容词)。在三个检测数据集和三个标题评估套件的精选切片上,我们发现一致的非语义敏感性,即即使是良性的空间编辑和简单的措辞变化也会使得分平均偏移约 6-9%,对于仅相隔 0.7% 的系统,这些偏移可导致在高达约 37% 的案例中发生排名翻转,尤其是在空间变化情形下。一项小规模的人类研究也支持这一发现,并确认标注者通常将扰动后的配对评为同样正确,因此这些得分变化反映的是评估器行为而非语义变化。我们进一步提出了不变性校准计分方法,这种后处理调整大约将中位数绝对敏感度减半,同时保持与学习型标题评估器的相关性。
引用
@article{arxiv.2605.24702,
title = {Do Image-Text Metrics Respect Semantic Invariances?},
author = {Amit Agarwal and Hitesh Laxmichand Patel and Meizhu Liu and Jyotika Singh and Karan Dua and Hansa Meghwani and Matthew Rowe and Michael Avendi and Yassi Abbasi and Tao Sheng and Sujith Ravi and Dan Roth},
journal= {arXiv preprint arXiv:2605.24702},
year = {2026}
}