ChatGPT的病例记录:语言模型与复杂临床问题
计算与语言
2023-05-10 v1 应用统计
摘要
背景:人工智能语言模型已在多种应用中展现出前景,包括在临床决策辅助方面,正如大型语言模型在医师执照考试中的强劲表现所证明的那样。然而,它们解决可能代表临床实践的复杂开放式病例的能力仍未被探索。方法:在本研究中,使用麻省总医院已发表的病例记录,考察了大型语言AI模型GPT4和GPT3.5诊断复杂临床病例的准确性。我们确定了2022年1月1日至2022年4月16日期间发表的、需要给出诊断和诊断性检查的共50个病例。对于每个病例,向模型提供提示,要求给出前三个具体诊断及相关的诊断性检查,随后提供病例文本、实验室数据和图注。将模型输出与最终临床诊断以及模型预测的检查是否能得出正确诊断进行比较。结果:GPT4和GPT3.5在一次尝试中分别准确给出正确诊断的占比为26%和22%,在三次尝试内分别为46%和42%。GPT4和GPT3.5在一次尝试中给出正确关键诊断性检查的占比为28%和24%,在三次尝试内分别为44%和50%。两模型间未发现显著差异,且使用GPT3.5模型以相同提示进行多次试验给出了相似结果。结论:总之,这些模型在生成鉴别诊断方面展现出潜在用处,但在复杂开放式病例中提供单一统一定诊断的能力仍然有限。未来研究应聚焦于在更大型的开放式临床挑战数据集上评估模型表现,并探索潜在的人-AI协作策略以增强临床决策。
引用
@article{arxiv.2305.05609,
title = {The Case Records of ChatGPT: Language Models and Complex Clinical Questions},
author = {Timothy Poterucha and Pierre Elias and Christopher M. Haggerty},
journal= {arXiv preprint arXiv:2305.05609},
year = {2023}
}
备注
9 pages, 2 figures