中文

MedArabiQ:评估大语言模型在阿拉伯语医疗任务上的基准

计算与语言 2025-08-25 v2 人工智能 人机交互

摘要

大语言模型(LLM)在医疗保健的各种应用中展现出巨大潜力。然而,由于缺乏高质量的特定领域数据集和基准,它们在阿拉伯语医疗领域的效能仍未得到探索。本研究引入了MedArabiQ,一个由七个阿拉伯语医疗任务组成的新型基准数据集,涵盖多个专科,包括多项选择题、填空题和医患问答。我们首先使用过往医学考试和公开可用数据集构建了该数据集。然后,我们引入了不同的修改来评估各种LLM能力,包括偏差缓解。我们对五个最先进的开源和专有LLM进行了广泛评估,包括GPT-4o、Claude 3.5-Sonnet和Gemini 1.5。我们的发现强调了创建跨越不同语言的高质量新基准的必要性,以确保LLM在医疗保健中的公平部署和可扩展性。通过建立此基准并发布数据集,我们为未来旨在评估和增强LLM多语言能力的研究奠定了基础,以实现生成式人工智能在医疗保健中的公平使用。

关键词

引用

@article{arxiv.2505.03427,
  title  = {MedArabiQ: Benchmarking Large Language Models on Arabic Medical Tasks},
  author = {Mouath Abu Daoud and Chaimae Abouzahir and Leen Kharouf and Walid Al-Eisawi and Nizar Habash and Farah E. Shamout},
  journal= {arXiv preprint arXiv:2505.03427},
  year   = {2025}
}

备注

21 pages