中文

CLIPScore:一种用于图像描述的无参考评价指标

计算机视觉与模式识别 2022-03-25 v3 计算与语言

摘要

图像描述 conventionally 依赖于基于参考的自动评价,即将机器生成的描述与人工书写的描述进行比较。这与人类评估描述质量的无参考方式形成对比。在本文中,我们报告了一个令人惊讶的经验发现:CLIP(Radford et al., 2021),一个在来自网络的 4 亿图像+描述对上预训练的跨模态模型,可用于对图像描述进行鲁棒的自动评价,而无需参考。跨越多个语料库的 experiments 表明,我们提出的新的无参考指标 CLIPScore 实现了与人工判断的最高相关性,优于现有的基于参考的指标如 CIDEr 和 SPICE。信息增益实验表明,CLIPScore 紧密关注图像-文本兼容性,与强调文本-文本相似性的现有基于参考的指标互补。因此,我们还提出了一种参考增强版本 RefCLIPScore,其实现了更高的相关性。除字面描述任务外,若干案例研究揭示了 CLIPScore 表现良好的领域(剪贴画图像、替代文本评分),但也揭示了其相对于基于参考的指标相对较弱的领域,例如需要更丰富上下文知识的新闻描述。

关键词

引用

@article{arxiv.2104.08718,
  title  = {CLIPScore: A Reference-free Evaluation Metric for Image Captioning},
  author = {Jack Hessel and Ari Holtzman and Maxwell Forbes and Ronan Le Bras and Yejin Choi},
  journal= {arXiv preprint arXiv:2104.08718},
  year   = {2022}
}