PersianMedQA:在波斯语-英语双语医学问答基准上评估大型语言模型
计算与语言
2026-05-27 v4 信息论
math.IT
摘要
大型语言模型(LLM)在广泛的自然语言处理(NLP)基准测试中取得了显著的性能,通常超越了人类水平的准确率。然而,它们在医学等高风险领域(尤其是在低资源语言中)的可靠性仍有待探索。在这项工作中,我们引入了 PersianMedQA,这是一个包含 20,785 道专家验证的波斯语医学多选题的大规模数据集,来源于 14 年的伊朗国家医学考试,涵盖 23 个医学专业,旨在评估波斯语和英语环境下的 LLM。我们对 41 个最先进的模型进行了基准测试,包括通用、波斯语和医学 LLM,在零样本和思维链设置下进行了评估。我们的结果表明,闭权重通用模型(例如 GPT-4.1)始终优于所有其他类别的模型,在波斯语中达到 83.09% 的准确率,在英语中达到 80.7%,而诸如 Dorna 之类的波斯语 LLM 表现明显不佳(例如在波斯语中为 34.9%),通常在指令遵循和领域推理方面都存在困难。我们还分析了翻译的影响,表明虽然英语性能通常更高,但由于翻译中丢失了文化和临床语境线索,有 3-10% 的问题只能在波斯语中正确回答。最后,我们证明,如果没有强大的领域或语言适应,仅靠模型大小不足以实现稳健的性能。PersianMedQA 为评估 LLM 中的双语和基于文化的医学推理奠定了基础。该数据集连同双语医学词典可在以下网址获取:https://huggingface.co/datasets/MohammadJRanjbar/PersianMedQA 。
引用
@article{arxiv.2506.00250,
title = {PersianMedQA: Evaluating Large Language Models on a Persian-English Bilingual Medical Question Answering Benchmark},
author = {Mohammad Javad Ranjbar Kalahroodi and Amirhossein Sheikholselami and Sepehr Karimi and Sepideh Ranjbar Kalahroodi and Heshaam Faili and Azadeh Shakery},
journal= {arXiv preprint arXiv:2506.00250},
year = {2026}
}
备注
Accepted at LREC 2026 (The Fifteenth Language Resources and Evaluation Conference), Palma, Mallorca, Spain, May 2026