KMMMU:面向韩语的大规模多学科多模态理解评估基准
计算与语言
2026-04-20 v2 机器学习
多媒体
摘要
我们提出 KMMMU,这是一个针对韩语语境下多模态理解的本土韩语基准测试。KMMMU 包含 3,466 题来自韩语原创考试的题目,覆盖九个学科和九个视觉模态类别,另外包含 300 题韩语专属子集以及 627 题的硬性子集。不同于翻译或以英语为中心的基准测试,KMMMU 针对受本地惯例、官方标准和学科特定视觉格式影响的信息密集问题。实验表明,最强开源模型在完整数据集上仅达到 42.05% 的准确率,而最佳专有模型在硬性子集上达到 52.42%。不同学科的表现存在差异,其中一些学科成为瓶颈,韩语专属题目显示最高可达 13.43% 的差距。错误分析表明,这些失败更多源于约定-标签映射不足、少量样本符号归纳、局部知识召回不足以及领域特定标准理解薄弱。KMMMU 为超越英语中心化基准测试并为开发可靠的专家级实际任务系统提供了测试平台。
引用
@article{arxiv.2604.13058,
title = {KMMMU: Evaluation of Massive Multi-discipline Multimodal Understanding in Korean Language and Context},
author = {Nahyun Lee and Guijin Son and Hyunwoo Ko and Chanyoung Kim and JunYoung An and Kyubeen Han and Il-Youp Kwak},
journal= {arXiv preprint arXiv:2604.13058},
year = {2026}
}
备注
8 pages