中文

面向肯尼亚初级护理的检索增强临床基准测试:情境模型测试的方法论论文

计算与语言 2025-07-22 v1 人工智能

摘要

大型语言模型(LLM)在改善低资源地区医疗可及性方面具有潜力,但其在非洲初级护理中的实际效果仍未得到充分探索。我们提出了一种创建针对肯尼亚二级和三级临床护理的基准数据集和评估框架的方法。该方法利用检索增强生成(RAG)技术,将临床问题锚定于肯尼亚国家指南,以确保符合当地标准。这些指南被数字化、分块并建立语义检索索引。随后,我们使用 Gemini Flash 2.0 Lite 模型,通过指南摘录生成真实的临床情景、选择题以及基于理由的答案,支持英文和斯瓦希利语。肯尼亚医生共同创建并完善了数据集,盲审专家审核确保了临床准确性、清晰度和文化适当性。最终得到的 Alama Health QA 数据集包含数千组符合监管要求的问答对,覆盖常见门诊病情。除准确性外,我们还引入了测试临床推理、安全性和适应性的评估指标,如罕见病例检测(Needle in the Haystack)、分步逻辑(Decision Points)和情境适应性。初始结果表明,当LLM被应用于本地化情景时,其表现存在显著差距,这与LLM在非洲医学内容上准确率低于美国基准测试的发现相一致。这一工作提供了一个可复制的模型,支持以指南为导向的动态基准测试,以促进非洲健康系统中AI的安全部署。

关键词

引用

@article{arxiv.2507.14615,
  title  = {Retrieval-Augmented Clinical Benchmarking for Contextual Model Testing in Kenyan Primary Care: A Methodology Paper},
  author = {Fred Mutisya and Shikoh Gitau and Christine Syovata and Diana Oigara and Ibrahim Matende and Muna Aden and Munira Ali and Ryan Nyotu and Diana Marion and Job Nyangena and Nasubo Ongoma and Keith Mbae and Elizabeth Wamicha and Eric Mibuari and Jean Philbert Nsengemana and Talkmore Chidede},
  journal= {arXiv preprint arXiv:2507.14615},
  year   = {2025}
}

备注

29 pages, 6 figs, 6 tables. Companion methods paper forthcoming