基于大语言模型的实时复合诊断医疗AI界面与医生在常见内科病例中使用模拟患者进行的比较
人工智能
2025-05-28 v1 计算与语言
摘要
目的 开发一个基于大语言模型(LLM)的实时复合诊断医疗AI界面,并基于美国医师执照考试(USMLE)第二步临床技能(CS)风格的考试,进行一项将该界面与医生在常见内科病例中进行比较的临床试验。方法 一项非随机临床试验于2024年8月20日进行。我们招募了一名全科医生、两名内科住院医师(二年级和三年级)以及五名模拟患者。临床案例改编自USMLE第二步CS风格的考试。我们基于真实患者开发了10个具有代表性的内科病例,并纳入了初步诊断评估中可用的信息。主要结局指标是首次鉴别诊断的准确率。可重复性基于一致率进行评估。结果 医生的首次鉴别诊断准确率在50%至70%之间,而实时复合诊断医疗AI界面的准确率达到80%。首次鉴别诊断的一致率为0.7。医生首次和第二次鉴别诊断的准确率在70%至90%之间,而AI界面的准确率达到100%。AI界面的平均用时(557秒)比医生的平均用时(1006秒)缩短了44.6%。AI界面的成本(0.08美元)也比医生的平均成本(4.2美元)降低了98.1%。患者对医生诊疗的满意度评分在4.2至4.3之间,对AI界面的满意度评分为3.9。结论 一个基于LLM的实时复合诊断医疗AI界面展示了与医生相当的诊断准确率和患者满意度,同时所需时间更短、成本更低。这些发现表明,AI界面可能具有辅助常见内科病例的初级保健咨询的潜力。
引用
@article{arxiv.2505.20609,
title = {Comparisons between a Large Language Model-based Real-Time Compound Diagnostic Medical AI Interface and Physicians for Common Internal Medicine Cases using Simulated Patients},
author = {Hyungjun Park and Chang-Yun Woo and Seungjo Lim and Seunghwan Lim and Keunho Kwak and Ju Young Jeong and Chong Hyun Suh},
journal= {arXiv preprint arXiv:2505.20609},
year = {2025}
}