中文

SPICE:语义命题图像描述评估

计算机视觉与模式识别 2016-08-01 v1 计算与语言

摘要

自动生成图像描述的任务受到了广泛关注。然而,其评估具有挑战性。现有的自动评估指标主要对 n-gram 重叠敏感,但这对于模拟人类判断既非必要也非充分。我们假设语义命题内容是人类描述评估的重要组成部分,并提出一种基于场景图定义的全新自动描述评估指标,将其命名为 SPICE。在多个模型和数据集上的广泛评估表明,与其他自动指标相比,SPICE 能更好地捕捉人类对模型生成描述的判断(例如,在 MS COCO 数据集上与人类判断的系统级相关性为 0.88,而 CIDEr 为 0.43,METEOR 为 0.53)。此外,SPICE 能够回答诸如“哪个描述生成器最理解颜色?”以及“描述生成器能计数吗?”等问题。

关键词

引用

@article{arxiv.1607.08822,
  title  = {SPICE: Semantic Propositional Image Caption Evaluation},
  author = {Peter Anderson and Basura Fernando and Mark Johnson and Stephen Gould},
  journal= {arXiv preprint arXiv:1607.08822},
  year   = {2016}
}

备注

14 pages plus references, accepted to ECCV 2016