AfriMed-QA:一个泛非洲、多学科、医学问答基准数据集
计算与语言
2025-09-23 v4
摘要
近期大型语言模型(LLM)在医学多选问答(MCQ)基准测试中的表现提升,已激发了全球医疗机构和患者的兴趣。尤其是在面临医生短缺和专家匮乏的中低收入国家(LMICs),LLM 提供了一条可扩展的途径,以提升医疗可及性并降低成本。然而,其在全球南方,尤其是非洲大陆的效果尚不明确。本文引入 AfriMed-QA,首个大规模泛非洲英语多学科医学问答(QA)数据集,收录 15,000 题问答(开放式和选择题),来自 60 多所医学院,覆盖 32 个医学专科。我们进一步评估了 30 个 LLM 在多个维度上的表现,包括正确性和人口统计偏差。我们的发现表明,不同专科和地区的表现存在显著差异,MCQ 表现明显落后于 USME(MedQA)。我们发现,生物医学 LLM 在一般模型和较小的边缘友好 LLM 方面表现不佳。有趣的是,人类评估显示,在 LLM 回答与解释与医生回答之间,消费者偏好一致地选择 LLM 的回答。
关键词
引用
@article{arxiv.2411.15640,
title = {AfriMed-QA: A Pan-African, Multi-Specialty, Medical Question-Answering Benchmark Dataset},
author = {Tobi Olatunji and Charles Nimo and Abraham Owodunni and Tassallah Abdullahi and Emmanuel Ayodele and Mardhiyah Sanni and Chinemelu Aka and Folafunmi Omofoye and Foutse Yuehgoh and Timothy Faniran and Bonaventure F. P. Dossou and Moshood Yekini and Jonas Kemp and Katherine Heller and Jude Chidubem Omeke and Chidi Asuzu MD and Naome A. Etori and Aimérou Ndiaye and Ifeoma Okoh and Evans Doe Ocansey and Wendy Kinara and Michael Best and Irfan Essa and Stephen Edward Moore and Chris Fourie and Mercy Nyamewaa Asiedu},
journal= {arXiv preprint arXiv:2411.15640},
year = {2025}
}
备注
ACL 2025 Main Conference (long paper, Best Social Impact Paper Award)