人类与大语言模型在临床决策支持中的应用:一项基于医学计算器的研究
计算与语言
2025-03-25 v2 人工智能
人机交互
摘要
尽管大语言模型(LLM)已通过执照考试在一般医学知识方面得到评估,但它们支持临床决策的能力,例如选择医学计算器,仍然不确定。我们评估了九个LLM,包括开源、专有和领域特定模型,使用1009个多选题答案对跨越35个临床计算器,并将LLM与人类在一部分问题上的表现进行比较。虽然表现最好的LLM——OpenAI o1——在100个问题的子集上提供了66.0%(置信区间:56.7-75.3%)的答案准确率,但两名人类标注者名义上优于LLM,平均答案准确率为79.5%(置信区间:73.5-85.0%)。最终,我们评估了医学实习生和LLM在临床场景(如风险分层和诊断)中推荐医学计算器的表现。错误分析显示,表现最好的LLM仍然在理解(49.3%的错误)和计算器知识(7.1%的错误)方面犯错,我们的研究结果强调LLM在计算器推荐方面并不优于人类。
引用
@article{arxiv.2411.05897,
title = {Humans and Large Language Models in Clinical Decision Support: A Study with Medical Calculators},
author = {Nicholas Wan and Qiao Jin and Joey Chan and Guangzhi Xiong and Serina Applebaum and Aidan Gilson and Reid McMurry and R. Andrew Taylor and Aidong Zhang and Qingyu Chen and Zhiyong Lu},
journal= {arXiv preprint arXiv:2411.05897},
year = {2025}
}
备注
10 pages, 3 figures, 2 tables