中文

KorMedMCQA:面向韩国医疗专业人员执业资格考试的多选题问答基准

计算与语言 2024-12-10 v3

摘要

我们提出了 KorMedMCQA,这是首个韩语医疗多选题问答基准,源自 2012 年至 2024 年间在韩国举行的专业医疗执业资格考试。该数据集包含来自医生、护士、药剂师和牙医考试的 7,469 道题目,涵盖了广泛的医学学科。我们评估了 59 个大型语言模型的性能,涵盖专有与开源模型、多语言与韩语专用模型,以及针对临床应用微调的模型。我们的结果表明,与直接回答方法相比,应用思维链(CoT)推理可将模型性能提升高达 4.5%。我们还调查了 MedQA(源自美国执业医师资格考试的最广泛使用的医疗基准之一)能否作为评估其他地区(此处为韩国)模型性能的可靠代理。我们对模型在 KorMedMCQA 和 MedQA 上的得分进行的相关性分析表明,这两个基准之间的一致性并不比来自完全不同领域的基准(例如 MedQA 和 MMLU-Pro)更好。这一发现凸显了韩国与美国医疗环境之间在语言和临床上的巨大差异,强化了对特定地区医疗问答基准的需求。为了支持韩国医疗人工智能的持续研究,我们通过 Huggingface 公开发布了 KorMedMCQA。

关键词

引用

@article{arxiv.2403.01469,
  title  = {KorMedMCQA: Multi-Choice Question Answering Benchmark for Korean Healthcare Professional Licensing Examinations},
  author = {Sunjun Kweon and Byungjin Choi and Gyouk Chu and Junyeong Song and Daeun Hyeon and Sujin Gan and Jueon Kim and Minkyu Kim and Rae Woong Park and Edward Choi},
  journal= {arXiv preprint arXiv:2403.01469},
  year   = {2024}
}