中文

KOFFVQA:面向大型视觉语言模型的客观评估韩语自由形式视觉问答基准

计算机视觉与模式识别 2025-04-01 v1 人工智能 计算与语言

摘要

近期大型视觉语言模型(VLM)的出现导致出现了各种不同的基准用于评估此类模型。尽管如此,我们注意到大多数现有评估方法都存在一个问题:要么要求模型从预确定的响应中进行选择,牺牲了开放性,要么使用评判模型进行评估,导致主观且不可靠的评估。此外,我们注意到缺乏针对韩语语言的 VLM 基准测试,这些基准测试是与更常见的英语语言基准测试不同的独立指标,因为生成式语言模型的性能会因所使用的语言而有很大差异。因此,我们提出 KOFFVQA,一个用于评估 VLM 的通用性韩语自由形式视觉问答基准。我们的基准由 275 个仔细精心构建的提问组成,每个提问配有一张图片和覆盖 VLM 性能 10 个不同方面的评分标准。评分标准通过允许评判模型基于预先确定的规则对每个响应进行评分来消除不可靠性问题。通过以客观方式定义评估标准,即使是小型开源模型也能可靠地对模型进行评估。除了在我们的基准上评估大量现有 VLM 之外,我们还实验验证了使用预存在的评分标准进行评估的方法比现有方法更可靠。我们的评估代码已公开于 https://github.com/maum-ai/KOFFVQA

关键词

引用

@article{arxiv.2503.23730,
  title  = {KOFFVQA: An Objectively Evaluated Free-form VQA Benchmark for Large Vision-Language Models in the Korean Language},
  author = {Yoonshik Kim and Jaeyoon Jung},
  journal= {arXiv preprint arXiv:2503.23730},
  year   = {2025}
}

备注

Accepted to CVPRW 2025, Workshop on Benchmarking and Expanding AI Multimodal Approaches