JMed48k:面向视觉语言模型评估的多职业日语医学许可证基准
计算机视觉与模式识别
2026-05-29 v2 人工智能
摘要
我们介绍 JMed48k,这是一个面向视觉语言模型评估的多职业日语医学许可证基准。该基准基于日本卫生劳动省公开的官方 PDF 材料构建,包含 48,862 份考试题目和 20,142 张图片,涵盖 2005 年至 2025 年的 11 个国家医学许可考试,图片按 8 种类型进行了标注。从该语料库中,我们派生出 JMed48k-Eval,即最近五年的评估子集,包含 12,484 题得分题目,其中包括 9,905 题纯文本题目和 2,579 题含图片题目。我们评估了 21 个专有、开源和医学专用模型,分别报告纯文本和含图片性能。由于这些子集包含不同的题目,我们进一步引入了配对图像删除审计,用以在删除视觉内容前后评估含图片题目,探讨四种答案转换状态。该审计显示,专有模型和开源模型在图像方面表现显著提升,而医学专用系统显示有限的视觉证据使用情况,在许多正确答案中删除图像后仍能保持正确。即便在专有模型中,净图像删除效应也在职业之间差异达七倍,从医师题目的 +5.7 分到公共卫生护士题目的 +39.8 分。我们发布 JMed48k 以支持医学许可证场景下面向职业分层的视觉语言模型可重复、可公开评估。
引用
@article{arxiv.2605.22080,
title = {JMed48k: A Multi-Profession Japanese Medical Licensing Benchmark for Vision-Language Model Evaluation},
author = {Yue Xun and Junyu Liu and Qian Niu and Xinyi Wang and Zheng Yuan and Zirui Li and Zequn Zhang and Bowen Zhao and Shujun Wang and Irene Li and Kan Hatakeyama-Sato and Yusuke Iwasawa and Yutaka Matsuo},
journal= {arXiv preprint arXiv:2605.22080},
year = {2026}
}