中文

JAMMEval:面向可靠VLM评估的日本基准数据集精化集合

计算机视觉与模式识别 2026-04-07 v2

摘要

可靠评估对于视觉-语言模型(VLM)的发展至关重要。然而,日本VQA基准数据集的迭代精化程度远不及英语基准数据集。因此,许多现有基准包含诸如问题模糊、答案错误以及无需视觉基础即可求解的实例等问题,削弱了评估的可靠性,并导致模型比较中产生误导性结论。为解决这些局限性,我们引入了JAMMEval——一个经过精化的日本基准数据集集合,用于可靠VLM评估。它通过对七个现有日本基准数据集进行两轮人工标注,系统性地进行精化,从而提升了数据质量和评估可靠性。在我们的实验中,我们在JAMMEval上评估了开源权重和专有VLM,并分析了近期模型在日本VQA任务上的能力。我们进一步通过展示精化后的基准数据集产生的评估分数能更好地反映模型能力、具有更低的运行间方差以及提升了区分不同能力水平模型的能力,证明了精化工作的有效性。我们发布了数据集和代码,以推动VLM的可靠评估。

关键词

引用

@article{arxiv.2604.00909,
  title  = {JAMMEval: A Refined Collection of Japanese Benchmarks for Reliable VLM Evaluation},
  author = {Issa Sugiura and Koki Maeda and Shuhei Kurita and Yusuke Oda and Daisuke Kawahara and Naoaki Okazaki},
  journal= {arXiv preprint arXiv:2604.00909},
  year   = {2026}
}

备注

16 pages, 11 figures