中文

PeruMedQA:面向智利医学考试的大语言模型基准测试——数据集构建与评估

计算与语言 2026-02-26 v2 机器学习

摘要

背景:医学大语言模型(LLM)在回答医学考试方面已显示出卓越的性能。然而,这种高性能是否可转移到西班牙语及来自拉美国家的医学问题上仍未探讨。这种知识对于在拉美地区获得LLM-based医学应用的推广至关重要。目标:构建由智利医师为专业培训考试所采用的问题数据集;对LLM进行微调;评估并比较原始LLM与微调后LLM在准确率上的表现。方法:我们精选了PeruMedQA,包含8380个跨越12个医学 specialty(2018-2025)的多选问答数据集。我们选取了十个医学LLM,包括medgemma-4b-it和medgemma-27b-text-it,并开发了零样本任务特定提示来回答问题。我们采用参数高效微调(PEFT)和低秩适配(LoRA)对medgemma-4b-it进行微调,仅使用除2025年(测试集)外的所有问题。结果:medgemma-27b在所有 specialty 中取得最高准确率,精神科最高达89.29%;然而在两个 specialty 中,OctoMed-7B略显优势:神经外科分别为77.27%和77.38%;放射科分别为76.13%和77.39%。在各 specialty 中,参数不足100亿的大多数LLM仅得到50%以下的正确答案。经微调的medgemma-4b-it在所有参数不足100亿的LLM中胜出,并在各种考试中与700亿参数的LLM相媲美。结论:对于需要来自西班牙语国家知识库且疾病流行病学特征与智利相似的医学AI应用和研究,相关方应使用medgemma-27b-text-it。

关键词

引用

@article{arxiv.2509.11517,
  title  = {PeruMedQA: Benchmarking Large Language Models (LLMs) on Peruvian Medical Exams -- Dataset Construction and Evaluation},
  author = {Rodrigo M. Carrillo-Larco and Jesus Lovón Melgarejo and Manuel Castillo-Cara and Gusseppe Bravo-Rocca},
  journal= {arXiv preprint arXiv:2509.11517},
  year   = {2026}
}

备注

https://github.com/rodrigo-carrillo/PeruMedQA