ContextRef:评估图像描述生成的无参考指标
计算与语言
2023-09-22 v1 计算机视觉与模式识别
摘要
无参考指标(如CLIPScore)使用预训练视觉—语言模型直接评估图像描述,无需昂贵的真实参考文本。此类方法可加速研究进展,但前提是它们真正与人类偏好判断相一致。本文中,我们引入ContextRef,一个用于评估无参考指标此种一致性的基准。ContextRef包含两部分:沿多种既定质量维度的人类评分,以及十个旨在揭示根本性弱点的多样性鲁棒性检验。ContextRef的一个关键方面是图像与描述以上下文形式呈现,这印证了先前表明上下文对描述质量重要的工作。使用ContextRef,我们评估了多种预训练模型、打分函数以及融入上下文的技术。现有方法均未能在ContextRef上取得成功,但我们展示细致的微调可带来显著改进。不过ContextRef仍具挑战性,很大程度上源于上下文依赖的困难。
引用
@article{arxiv.2309.11710,
title = {ContextRef: Evaluating Referenceless Metrics For Image Description Generation},
author = {Elisa Kreiss and Eric Zelikman and Christopher Potts and Nick Haber},
journal= {arXiv preprint arXiv:2309.11710},
year = {2023}
}