中文

无参考图像描述评测指标的鲁棒性考察

计算与语言 2024-02-07 v2 人工智能 计算机视觉与模式识别 机器学习

摘要

近来,诸如 CLIPScore(Hessel 等,2021)、UMIC(Lee 等,2021)和 PAC-S(Sarto 等,2023)等无参考指标被提出,用于图像描述的无参考自动评测。我们的重点在于评估这些指标在需要区分具有高词汇重叠但含义迥异的两段描述之场景下的鲁棒性。我们的发现表明,尽管这些指标与人类判断高度相关,CLIPScore、UMIC 和 PAC-S 仍难以识别细粒度错误。虽然所有指标对视觉接地错误表现出强敏感性,但它们对描述不合理错误的敏感性有限。此外,我们发现所有指标对描述中提到的图像相关物体大小的变化均敏感,而 CLIPScore 和 PAC-S 还对描述中图像相关物体的提及次数敏感。关于描述的语言学方面,所有指标对否定的理解较弱,且 CLIPScore 和 PAC-S 在很大程度上对描述结构不敏感。我们希望我们的发现能指导图像描述无参考评测的进一步改进。

关键词

引用

@article{arxiv.2305.14998,
  title  = {An Examination of the Robustness of Reference-Free Image Captioning Evaluation Metrics},
  author = {Saba Ahmadi and Aishwarya Agrawal},
  journal= {arXiv preprint arXiv:2305.14998},
  year   = {2024}
}