中文

CapArena:面向 LLM 时代的详细图像描述基准测试与分析

计算机视觉与模式识别 2025-03-18 v1 计算与语言

摘要

图像描述是视觉语言研究中的一个长期存在的挑战。随着 LLM 的兴起,现代视觉语言模型(VLM)生成详细且全面的图像描述。然而,对此类描述质量的基准测试仍未得到解决。本文回答了两个关键问题:(1)当前 VLM 在图像描述方面表现如何,尤其是与人类相比如何?我们构建了 CapArena,一个包含超过 6000 对描述对战和高质量人类偏好投票的平台。我们的竞技场式评估标志着一个里程碑,表明领先模型如 GPT-4o 实现或甚至超越了人类表现,而大多数开源模型则落后于人类。(2)自动化指标能否可靠地评估详细的描述质量?使用来自 CapArena 的人类注释,我们评估了传统和最新的描述指标,以及 VLM 作为判官。我们的分析显示,虽然某些指标(如 METEOR)在与人类水平一致性方面表现尚可,但其系统性偏差导致模型排序不一致。相比之下,VLM 作为判官在描述和模型层面表现出鲁棒的辨别能力。基于这些见解,我们发布了 CapArena-Auto,一个准确且高效的详细描述基准,仅需 4 美元即可实现 94.3% 的人类排名相关性。数据和资源将在 https://caparena.github.io 对外开放。

关键词

引用

@article{arxiv.2503.12329,
  title  = {CapArena: Benchmarking and Analyzing Detailed Image Captioning in the LLM Era},
  author = {Kanzhi Cheng and Wenpo Song and Jiaxin Fan and Zheng Ma and Qiushi Sun and Fangzhi Xu and Chenyang Yan and Nuo Chen and Jianbing Zhang and Jiajun Chen},
  journal= {arXiv preprint arXiv:2503.12329},
  year   = {2025}
}