中文

AVA-Bench:视觉基础模型的原子视觉能力基准测试

计算机视觉与模式识别 2026-05-05 v5 人工智能 机器学习

摘要

视觉基础模型(VFMs)的兴起呼唤系统性的评估。一种常见方法是将VFMs与大语言模型(LLMs)配对作为通用头部,然后在广泛的视觉问答(VQA)基准上进行评估。然而,该协议存在两个关键盲点:(i)指令微调数据可能与VQA测试分布不匹配,意味着错误预测可能源于这种数据不匹配而非VFM的视觉缺陷;(ii)VQA基准通常需要多种视觉能力,难以判断错误是源于缺乏所有所需能力还是仅缺少某一项关键能力。为弥补这些空白,我们引入了AVA-Bench,第一个明确解耦14种原子视觉能力(AVAs)的基准——这些基础技能如定位、深度估计和空间理解,共同支撑复杂的视觉推理任务。通过解耦AVAs并在每个能力内匹配训练与测试分布,AVA-Bench精确指出了VFM在何处表现出色或不足。将AVA-Bench应用于领先的VFMs thus揭示了独特的"能力指纹",将VFM选择从经验猜测转变为有原则的工程。值得注意的是,我们发现一个0.5B LLM在削减8倍GPU小时的情况下产生了与7B LLM相似的VFM排名,实现了更高效的评估。通过提供全面且透明的基准,我们希望AVA-Bench为下一代VFMs奠定基础。

关键词

引用

@article{arxiv.2506.09082,
  title  = {AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models},
  author = {Zheda Mai and Arpita Chowdhury and Zihe Wang and Sooyoung Jeon and Lemeng Wang and Jiacheng Hou and Jihyung Kil and Wei-Lun Chao},
  journal= {arXiv preprint arXiv:2506.09082},
  year   = {2026}
}

备注

Accepted by CVPR 2026. The first two authors contribute equally