中文

稀有疾病诊断大语言模型评估:以《House M.D.》为案例研究

计算与语言 2025-11-17 v1 人工智能

摘要

大语言模型(LLM)在 diverse 领域已展示出能力,但其在从叙事性医疗病例中进行稀有疾病诊断方面的表现尚未得到充分探索。我们引入了一个新数据集,从经验证的医学教育教材《House M.D.》中提取 176 个症状-诊断对。我们评估了四个最先进的 LLM,如 GPT 4o mini、GPT 5 mini、Gemini 2.5 Flash 和 Gemini 2.5 Pro 在叙事性诊断推理任务上的表现。结果显示性能存在显著差异,准确率范围为 16.48%至 38.64%,较新的模型生成版本显示出 2.3 倍的改进。尽管所有模型在稀有疾病诊断方面都面临重大挑战,但所观察到的跨架构的改进表明未来发展有前景。我们的教育验证基准建立了叙事性医疗推理的基准性能指标,提供了一个公开可访问的评估框架,用于推进 AI 辅助诊断研究。

关键词

引用

@article{arxiv.2511.10912,
  title  = {Evaluating Large Language Models on Rare Disease Diagnosis: A Case Study using House M.D},
  author = {Arsh Gupta and Ajay Narayanan Sridhar and Bonam Mingole and Amulya Yadav},
  journal= {arXiv preprint arXiv:2511.10912},
  year   = {2025}
}