指标是否在度量其理应度量的内容?图像描述任务指标的一项评估
计算机视觉与模式识别
2023-02-15 v2
摘要
图像描述是一项利用场景中物体及其关系来描述图像内容的研究任务。为解决该任务,人工智能视觉与自然语言处理两个重要研究领域交汇。在图像描述中,如同任何计算智能任务一样,性能度量指标对于了解方法表现优劣至关重要。近年来,人们观察到基于 n-gram 的经典指标不足以捕捉描述图像内容所需的语义与关键含义。为衡量当前及较新指标集合的表现好坏,本文对多种图像描述指标进行了评估,并使用知名的 MS COCO 数据集在它们之间做了比较。这些指标选自既往工作中最常用的那些:基于 -gram 的如 BLEU、SacreBLEU、METEOR、ROGUE-L、CIDEr、SPICE,以及基于嵌入的如 BERTScore 与 CLIPScore。为此,我们设计了两个场景:1)一组人工构建的具有多种质量的描述文本;2)若干最先进图像描述方法的比较。在试图回答以下问题时有有趣发现:当前指标是否有助于产生高质量描述?实际指标彼此间如何比较?指标究竟在度量什么?
引用
@article{arxiv.2207.01733,
title = {Are metrics measuring what they should? An evaluation of image captioning task metrics},
author = {Othón González-Chávez and Guillermo Ruiz and Daniela Moctezuma and Tania A. Ramirez-delReal},
journal= {arXiv preprint arXiv:2207.01733},
year = {2023}
}