中文

VHELM:面向视觉语言模型的全面评估

计算机视觉与模式识别 2024-10-25 v2 人工智能

摘要

当前评估视觉语言模型(VLM)的基准通常聚焦于其感知或问题解决能力,忽略了公平性、多语言性或有毒性等其他关键方面。此外,它们在评估程序和评估范围上存在差异,难以进行模型比较。为解决这些问题,我们将 HELM 框架扩展到 VLM,以提出视觉语言模型的全面评估(VHELM)。VHELM 聚合 various 数据集,覆盖 9 个方面中的一个或多个:视觉感知、知识、推理、偏见、公平性、多语言性、鲁棒性、有毒性和安全性。通过这种方式,VHELM 提供了对 VLM 在这些重要因素上的能力的全面、多维度视图。此外,我们标准化了标准推理参数、提示方法和评估指标,以便在模型之间进行公平比较。该框架设计轻便且自动化,以便评估运行成本低且速度快。我们的初始运行在 21 个现有数据集上评估了 22 个 VLM,以提供模型的全面快照。我们发现,效率导向的模型(如 Claude 3 Haiku 或 Gemini 1.5 Flash)在偏见基准上显著差于其完整模型(如 Claude 3 Opus 或 Gemini 1.5 Pro),但在其他评估方面表现不显著。为透明度,我们在网站上发布原始模型生成和完整结果(https://crfm.stanford.edu/helm/vhelm/v2.0.1)。VHELM 旨在成为一个持续演进的基准,期望不断添加新的数据集和模型。

关键词

引用

@article{arxiv.2410.07112,
  title  = {VHELM: A Holistic Evaluation of Vision Language Models},
  author = {Tony Lee and Haoqin Tu and Chi Heem Wong and Wenhao Zheng and Yiyang Zhou and Yifan Mai and Josselin Somerville Roberts and Michihiro Yasunaga and Huaxiu Yao and Cihang Xie and Percy Liang},
  journal= {arXiv preprint arXiv:2410.07112},
  year   = {2024}
}

备注

NeurIPS 2024. First three authors contributed equally