Dysca:面向大视觉语言模型感知能力评估的动态可扩展基准
计算机视觉与模式识别
2025-02-25 v4
摘要
目前已提出许多基准用于评估大视觉语言模型(LVLMs)的感知能力。然而,这些大多数基准通过选取现有数据集中的图像提出问题,存在潜在的数据泄露问题。此外,这些基准仅聚焦于在真实风格图像和干净场景下的评估,未探索多样化图像和噪声场景。为应对这些挑战,本文提出一种名为 Dysca 的动态可扩展基准,通过合成图像评估 LVLMs。具体而言,我们利用 Stable Diffusion 并设计一种基于规则的方法,动态生成新图像、问题及相应答案。我们考虑 51 种图像风格,并在 20 个子任务中评估感知能力。此外,我们在 4 种场景(即干净、损坏、印刷攻击和对抗攻击)和 3 种问题类型(即多选、真假判断和自由回答)下进行评估。由于采用生成式方法,Dysca 能够轻松添加新的子任务和场景。我们在 Dysca 上评估了 24 个开源 LVLMs 和 2 个闭源 LVLMs,揭示了当前 LVLMs 的局限性。该基准已发布于 https://github.com/Robin-WZQ/Dysca。
引用
@article{arxiv.2406.18849,
title = {Dysca: A Dynamic and Scalable Benchmark for Evaluating Perception Ability of LVLMs},
author = {Jie Zhang and Zhongqi Wang and Mengqi Lei and Zheng Yuan and Bei Yan and Shiguang Shan and Xilin Chen},
journal= {arXiv preprint arXiv:2406.18849},
year = {2025}
}
备注
Accepted by ICLR2025