中文

JMMMU:日语大型多模态理解基准测试

计算与语言 2025-03-20 v2 人工智能 计算机视觉与模式识别

摘要

加速日语语言大型多模态模型(LMM)的研究对于提升更广泛人群的用户体验至关重要。本文介绍JMMMU (Japanese MMMU),首个大型日语基准测试,旨在评估LMM在日语语境下的 expert-level 任务。为促进全面文化感知评估,JMMMU包含两个互补子集:(i)文化中性(CA)子集,其中选取文化无关科目(如数学),翻译为日语,实现与其英文对应基准MMMU的一对一比较;(ii)文化特定(CS)子集,包含反映日语文化背景的新编科目。通过CA子集,我们观察到许多LMM在日语评估中表现下降,这纯粹归因于语言变化。通过CS子集,我们揭示了其不足的日语文化理解能力。进一步地,通过合并两个子集,我们发现一些LMM在CA子集上表现良好但在CS子集上表现不佳,这暴露了其日语理解浅而不深,缺乏文化理解的深度。我们希望本工作不仅有助于提升LMM在日语中的性能,也可作为为多语言LMM开发创建高标准、文化多样化基准测试的指南。项目页面已公开。

关键词

引用

@article{arxiv.2410.17250,
  title  = {JMMMU: A Japanese Massive Multi-discipline Multimodal Understanding Benchmark for Culture-aware Evaluation},
  author = {Shota Onohara and Atsuyuki Miyai and Yuki Imajuku and Kazuki Egashira and Jeonghun Baek and Xiang Yue and Graham Neubig and Kiyoharu Aizawa},
  journal= {arXiv preprint arXiv:2410.17250},
  year   = {2025}
}

备注

Accepted at NAACL 2025. Project page: https://mmmu-japanese-benchmark.github.io/JMMMU/