中文

BLUEX 再探:通过自动图像描述增强基准测试覆盖率

计算与语言 2025-09-01 v1 人工智能

摘要

随着大语言模型(LLM)能力的不断增强,对稳健评估方法的需求日益增长,尤其是在多语言和非英语语境下。我们提出了 BLUEX 数据集的更新版本,现在包含 2024-2025 年的考试,并使用最先进的模型自动生成图像描述,从而增强了其在 LLM 预训练数据污染研究中的相关性。描述策略使纯文本模型的可访问性提高了 40% 以上,产生了 1,422 道可用问题,是原版 BLUEX 中数量的两倍多。我们评估了商业和开源 LLM 及其通过描述利用视觉上下文的能力。

关键词

引用

@article{arxiv.2508.21294,
  title  = {BLUEX Revisited: Enhancing Benchmark Coverage with Automatic Captioning},
  author = {João Guilherme Alves Santos and Giovana Kerche Bonás and Thales Sales Almeida},
  journal= {arXiv preprint arXiv:2508.21294},
  year   = {2025}
}

备注

12 pages, 5 figures, 2 tables