JMMMU-Pro:基于Vibe Benchmark Construction的图像式日语多学科多模态理解基准
计算与语言
2025-12-17 v1 人工智能
计算机视觉与模式识别
摘要
本文介绍JMMMU-Pro,这是一个图像式日语多学科多模态理解基准,以及Vibe Benchmark Construction,这是一种可扩展的构建方法。跟随从MMMU到MMMU-Pro的演进,JMMMU-Pro扩展了JMMMU,通过将问题图像和问题文本组合为单个图像,从而创建一个需要通过视觉感知进行整合视觉-文本理解的基准。为构建JMMMU-Pro,我们提出Vibe Benchmark Construction,即一种方法,其中图像生成模型(如Nano Banana Pro)产生候选视觉问题,人类验证输出并在必要时通过调整提示词重新生成,以确保质量。利用Nano Banana Pro的高度逼真图像生成能力及其嵌入干净日文文本的能力,我们以低成本构建了覆盖广泛背景和布局设计的高质量基准。实验结果表明,所有开源多模态大语言模型在JMMMU-Pro上表现 substantially 差,凸显了JMMMU-Pro作为指导未来社区工作的重要基准。我们认为JMMMU-Pro为评估LMM的日语能力提供了更严格的评估工具,而我们的Vibe Benchmark Construction也为未来开发图像式VQA基准提供了有效的指南。
引用
@article{arxiv.2512.14620,
title = {JMMMU-Pro: Image-based Japanese Multi-discipline Multimodal Understanding Benchmark via Vibe Benchmark Construction},
author = {Atsuyuki Miyai and Shota Onohara and Jeonghun Baek and Kiyoharu Aizawa},
journal= {arXiv preprint arXiv:2512.14620},
year = {2025}
}
备注
Project page: https://mmmu-japanese-benchmark.github.io/JMMMU_Pro/