中文

ContextRef:评估图像描述生成的无参考指标

计算与语言 2023-09-22 v1 计算机视觉与模式识别

摘要

无参考指标(如CLIPScore)使用预训练视觉—语言模型直接评估图像描述,无需昂贵的真实参考文本。此类方法可加速研究进展,但前提是它们真正与人类偏好判断相一致。本文中,我们引入ContextRef,一个用于评估无参考指标此种一致性的基准。ContextRef包含两部分:沿多种既定质量维度的人类评分,以及十个旨在揭示根本性弱点的多样性鲁棒性检验。ContextRef的一个关键方面是图像与描述以上下文形式呈现,这印证了先前表明上下文对描述质量重要的工作。使用ContextRef,我们评估了多种预训练模型、打分函数以及融入上下文的技术。现有方法均未能在ContextRef上取得成功,但我们展示细致的微调可带来显著改进。不过ContextRef仍具挑战性,很大程度上源于上下文依赖的困难。

关键词

引用

@article{arxiv.2309.11710,
  title  = {ContextRef: Evaluating Referenceless Metrics For Image Description Generation},
  author = {Elisa Kreiss and Eric Zelikman and Christopher Potts and Nick Haber},
  journal= {arXiv preprint arXiv:2309.11710},
  year   = {2023}
}