中文

KorMedMCQA-V:韩国医学执照考试多模态问答基准

计算机视觉与模式识别 2026-02-17 v1 人工智能 计算与语言

摘要

我们介绍KorMedMCQA-V,一个韩国医学执照考试风格的多模态多选问答基准,用于评估视觉语言模型(VLM)。数据集包含1534个问题,配有2043张图片,来源于韩国医学执照考试(2012-2023年),约30%的问题包含多个图片需跨图证据集成。图片覆盖X光、CT、心电图(ECG)、超声、内镜及其他医学影像。我们在统一的零样体评估协议下对50多个VLM进行基准测试,涵盖专有模型和开源模型——分别包括通用型、医学专用型和韩国专用型家族。最佳专有模型(Gemini-3.0-Pro)达到96.9%准确率,最佳开源模型(Qwen3-VL-32B-Thinking)为83.7%,最佳韩国专用模型(VARCO-VISION-2.0-14B)仅为43.2%。我们进一步发现,面向推理的模型变体在指令微调版基础上可提升最高20个百分点,医学领域专业化对强大的通用基线模型效果不一致,所有模型在多图问题表现下降,而不同影像模态下的性能差异显著。通过补充文本-only KorMedMCQA基准,KorMedMCQA-V形成韩国医学推理在文本-only和多模态条件下的统一评估套件。数据集已通过 Hugging Face Datasets发布:https://huggingface.co/datasets/seongsubae/KorMedMCQA-V。

关键词

引用

@article{arxiv.2602.13650,
  title  = {KorMedMCQA-V: A Multimodal Benchmark for Evaluating Vision-Language Models on the Korean Medical Licensing Examination},
  author = {Byungjin Choi and Seongsu Bae and Sunjun Kweon and Edward Choi},
  journal= {arXiv preprint arXiv:2602.13650},
  year   = {2026}
}

备注

17 pages, 2 figures, 6 tables. (Includes appendix.)