中文

BYO-Eval:构建用于多模态语言模型细粒度视觉评估的数据集

计算机视觉与模式识别 2025-06-09 v1 人工智能 计算与语言

摘要

视觉语言模型 (VLM) 已发展到足以支持广泛的应用,包括回答复杂视觉问题,日益被期望以多种方式与图像交互。为评估它们,当前基准往往聚焦于特定领域(如读取图表),构建带有注释的真实图像配以预定义的多选题 (MCQ),以报告整体准确率。然而,这类基准需高额标注成本、存在信息泄露风险,且无法厘清失败原因是视觉感知、推理还是常识的局限。我们提出一种新评估方法,灵感来自眼科诊断,利用合成图像的程序生成以控制视觉属性,精准揭示 VLM 的感知缺陷。具体而言,我们构建图像集合,逐步增加感兴趣内容的难度变体(如计数任务中对象的数量),同时保持其他视觉参数恒定。这种诊断方法实现了系统化的压力测试和细粒度的错误分析,将评估焦点从粗略的基准测试转向针对性且可解释的 VLM 能力评估。我们的代码已公开于 https://github.com/byoeval/BYO-EVAL。

关键词

引用

@article{arxiv.2506.05440,
  title  = {BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models},
  author = {Ludovic Arnould and Salim Khazem and Hugues Ali Mehenni},
  journal= {arXiv preprint arXiv:2506.05440},
  year   = {2025}
}