波兰-英语医学知识迁移:新基准及其结果
计算与语言
2025-09-15 v2 人工智能
摘要
大语言模型(LLMs)在处理专业任务方面显示出巨大的潜力,包括医学问题解决。然而,大多数研究主要聚焦于英语语境。本文引入基于波兰医学执照和专科考试(LEK, LDEK, PES)的新基准数据集,这些考试是医学执业医生候选人和正在从事专科培训的医生所参加的考试。数据集从医学考试中心和主任医师会所提供的公开资源中进行网页抓取。其包含超过 24,000 题的考试问题,其中包括一部分平行波兰-英语语料库,英语部分由考试中心为外籍考生进行专业翻译。通过从这些现有考试问题中构建结构化基准,我们系统评估了最先进的 LLMs,包括通用-purpose、领域-specific 和波兰-specific 模型,并将其性能与人类医学学生进行比较。我们的分析显示,虽然 GPT-4o 等模型实现了接近人类的性能,但在跨语言翻译和领域-specific 理解方面仍面临重大挑战。这些发现凸显了模型在不同语言和医学专科之间性能差异,突显了在临床实践中部署 LLMs 的局限性和伦理考虑。
引用
@article{arxiv.2412.00559,
title = {Polish-English medical knowledge transfer: A new benchmark and results},
author = {Łukasz Grzybowski and Jakub Pokrywka and Michał Ciesiółka and Jeremi I. Kaczmarek and Marek Kubis},
journal= {arXiv preprint arXiv:2412.00559},
year = {2025}
}