Mind the Gap:评估量化医学语言推理 LLM 基准对非洲疾病负担的代表性
人工智能
2025-07-23 v1
摘要
引言:现有医学 LLM 基准主要反映高收入地区的考试大纲和疾病特征,这对其在非洲部署的有效性提出了质疑,因为在非洲,疟疾、HIV、TB、镰状细胞病和其他被忽视的热带病(NTD)主导疾病负担,且国家指南指导临床治疗。方法:我们系统综述了 31 篇量化 LLM 评估论文(2019 年 1 月至 2025 年 5 月),识别出 19 个英文医学 QA 基准。Alama Health QA 使用基于肯尼亚临床实践指南的检索增强生成框架开发。六个广泛使用的数据集(AfriMedQA、MMLUMedical、PubMedQA、MedMCQA、MedQAUSMLE 和基于指南的 Alama Health QA)经过统一的语义分析(NTD 比例、时效性、可读性、词汇多样性指标)和五个维度的盲法专家评级:临床相关性、指南一致性、清晰度、干扰项合理性和语言/文化契合度。结果:Alama Health QA 在语料库中捕获了 >40% 的所有 NTD 提及,且在数据集内疟疾(7.7%)、HIV(4.1%)和 TB(5.2%)的频率最高;AfriMedQA 排名第二但缺乏正式的指南关联。全球基准显示代表性极低(例如,镰状细胞病在三个数据集中缺失),尽管其规模较大。定性方面,Alama 在相关性和指南一致性上得分最高;PubMedQA 在临床实用性上得分最低。讨论:文献中广泛使用的量化医学 LLM 基准低估了非洲疾病负担和监管背景,可能导致误导性的性能声明。基于指南、区域策划的资源(如 Alama Health QA)及扩展的疾病特定衍生资源,对于在非洲卫生系统中进行安全、公平的模型评估和部署至关重要。
引用
@article{arxiv.2507.16322,
title = {Mind the Gap: Evaluating the Representativeness of Quantitative Medical Language Reasoning LLM Benchmarks for African Disease Burdens},
author = {Fred Mutisya and Shikoh Gitau and Christine Syovata and Diana Oigara and Ibrahim Matende and Muna Aden and Munira Ali and Ryan Nyotu and Diana Marion and Job Nyangena and Nasubo Ongoma and Keith Mbae and Elizabeth Wamicha and Eric Mibuari and Jean Philbert Nsengemana and Talkmore Chidede},
journal= {arXiv preprint arXiv:2507.16322},
year = {2025}
}
备注
Preprint. 26 pages, includes appendix and tables