中文

GPT-4 在医学挑战性问题上的能力评估

计算与语言 2023-04-13 v2 人工智能

摘要

大语言模型(LLMs)已在包括医学在内的多个领域的自然语言理解与生成中展现出显著能力。我们对最先进的 LLM——GPT-4 在医学能力考试与基准数据集上进行了全面评估。GPT-4 是一个通用模型,并未通过训练专门针对医学问题或 engineered 以解决临床任务。我们的分析涵盖美国医师执照考试(USMLE)的两套官方练习材料,该三步考试项目用于评估临床能力并授予美国行医许可。我们还评估了在 MultiMedQA 基准数据集套件上的表现。除衡量模型性能外,我们开展了实验以探究含文本与图像的试题对模型性能的影响、探查训练期间的内容记忆情况,并研究概率校准——这在医学等高风险应用中至关重要。我们的结果表明,无需任何专门提示设计,GPT-4 在 USMLE 上超出及格分 20 余分,且优于早期的通用模型(GPT-3.5)以及专门针对医学知识微调的模型(Med-PaLM,即 Flan-PaLM 540B 的提示微调版本)。此外,GPT-4 的校准显著优于 GPT-3.5,展现出大幅改进的对其答案正确概率的预测能力。我们还通过案例研究定性探索了模型行为,显示 GPT-4 能够解释医学推理、向学生个性化解释,并围绕医学案例交互式构建新的反事实情景。文中讨论了上述发现对 GPT-4 在医学教育、评估与临床实践中潜在应用的启示,并适当关注准确性与安全性的挑战。

关键词

引用

@article{arxiv.2303.13375,
  title  = {Capabilities of GPT-4 on Medical Challenge Problems},
  author = {Harsha Nori and Nicholas King and Scott Mayer McKinney and Dean Carignan and Eric Horvitz},
  journal= {arXiv preprint arXiv:2303.13375},
  year   = {2023}
}

备注

35 pages, 15 figures; added GPT-4-base model results and discussion