中文

利用视觉-语言模型进行图像-文本检索评估的自动相关性判断

信息检索 2024-08-05 v1 计算与语言 计算机视觉与模式识别 多媒体

摘要

视觉-语言模型(VLMs)在多种应用中已展示出成功,但其在辅助相关性判断方面的潜力仍不确定。本文评估了 VLMs(包括 CLIP、LLaVA 和 GPT-4V)在大规模临时检索任务中的相关性估计能力,该任务针对多媒体内容创作以零样本方式进行。初步实验揭示以下结果:(1)LLaVA 和 GPT-4V(包括开源和闭源的视觉指令微调大语言模型)与人类相关性判断相比,达到了显著的 Kendall τ0.4\tau \sim 0.4,超越了 CLIPScore 指标。(2)虽然 CLIPScore 更受青睐,但 LLMs 对基于 CLIP 的检索系统的偏见较小。(3)GPT-4V 的得分分布比其他模型更接近人类判断,其 Cohen κ\kappa 值约为 0.08,优于 CLIPScore 的约 -0.096。这些发现强调了基于 LLM 的 VLMs 在增强相关性判断方面的潜力。

关键词

引用

@article{arxiv.2408.01363,
  title  = {Toward Automatic Relevance Judgment using Vision--Language Models for Image--Text Retrieval Evaluation},
  author = {Jheng-Hong Yang and Jimmy Lin},
  journal= {arXiv preprint arXiv:2408.01363},
  year   = {2024}
}

备注

Accepted by ACM SIGIR 2024 LLM4Eval Workshop: https://llm4eval.github.io/papers