中文

CHIRP:面向视觉语言模型开放式响应评估的细粒度基准

计算机视觉与模式识别 2025-08-06 v3 人工智能

摘要

过去几年视觉语言模型的激增需要严格且全面的评估方法和基准。本工作分析了现有的 VLM 评估技术,包括跨多种任务的自动指标、基于 AI 的评估和人工评估。我们首先引入了 Robin——我们通过在多个尺度上结合大型语言模型(LLM)和视觉编码器构建的一套全新 VLM 套件,并使用 Robin 识别了当前评估方法在不同尺度上的缺陷。接下来,为了克服已识别的局限性,我们引入了 CHIRP——我们为更鲁棒和完整的 VLM 评估而开发的一种新型长篇响应基准。我们开放了 Robin 训练代码、模型套件和 CHIRP 基准的访问权限,以促进可复现性并推动 VLM 研究。

关键词

引用

@article{arxiv.2501.09672,
  title  = {CHIRP: A Fine-Grained Benchmark for Open-Ended Response Evaluation in Vision-Language Models},
  author = {Alexis Roger and Prateek Humane and Daniel Z. Kaplan and Kshitij Gupta and Qi Sun and George Adamopoulos and Jonathan Siu Chi Lim and Quentin Anthony and Edwin Fennell and Irina Rish},
  journal= {arXiv preprint arXiv:2501.09672},
  year   = {2025}
}