CUPCase:临床罕见病例与诊断数据集
计算与语言
2025-03-11 v1 人工智能
机器学习
摘要
医学基准数据集对开发用于医学知识提取、诊断、摘要整理和其他用途的大语言模型(LLM)做出了重要贡献。然而,当前的基准主要源自给医学生的考试题目或医学文献中描述的病例,缺乏现实世界患者病例的复杂性,这些病例往往偏离经典的教科书抽象。这包括罕见疾病、常见疾病的罕见表现以及意外的治疗反应。在此,我们基于来自 BMC 的 3,562 份真实世界病例报告,构建了临床罕见病例与诊断数据集(CUPCase),包含开放式文本格式的诊断以及带有干扰项的多项选择题选项。利用该数据集,我们评估了 SOTA LLM(包括通用 LLM 和临床 LLM)识别并正确诊断患者病例的能力,并测试了在仅有病例部分信息可用时模型的性能。我们的研究结果表明,通用型 GPT-4o 在多项选择题任务(平均准确率 87.9%)和开放式任务(BERTScore F1 为 0.764)中均取得了最佳性能,优于 Meditron-70B 和 MedLM-Large 等多个专注于医疗领域的 LLM。此外,在多项选择题和自由文本任务中,即使仅提供病例前 20% 的 token,GPT-4o 仍能分别保持其 87% 和 88% 的性能,突显了 LLM 在现实世界病例中辅助早期诊断的潜力。CUPCase 以开放和可复现的方式扩展了我们评估用于临床决策支持的 LLM 的能力。
引用
@article{arxiv.2503.06204,
title = {CUPCase: Clinically Uncommon Patient Cases and Diagnoses Dataset},
author = {Oriel Perets and Ofir Ben Shoham and Nir Grinberg and Nadav Rappoport},
journal= {arXiv preprint arXiv:2503.06204},
year = {2025}
}
备注
Accepted to AAAI 2025