通用大型语言模型在结合上下文评估成人重症监护电子健康记录笔记中提取的语义概念时的评估
计算与语言
2024-01-25 v1 人工智能
软件工程
摘要
由于出色的性能,医疗保健领域越来越关注大型语言模型(LLMs)。然而,它们在实际临床应用中的性能尚未得到充分探索。基于问答任务的传统评估无法完全捕捉细微的上下文。这一差距凸显了在真实世界医疗保健环境中对 LLMs 进行更深入、更实用评估的必要性。目的:我们旨在使用系统且易于理解的解析方法(包括临床医生标注和裁定),评估 LLMs 在成人重症监护医学这一复杂临床环境中的性能。方法:我们研究了三种通用 LLMs 在理解和处理真实世界临床笔记方面的性能。通过 MetaMap 从 150 份临床笔记中识别出概念,随后由 9 位临床医生进行标注。通过使用不同的提示词识别这些概念的时间性和否定性,对每个 LLM 的熟练程度进行了深入分析的评估。结果:与其他 LLMs 相比,GPT-4 表现出总体更优的性能。相比之下,当采用适当的提示策略时,GPT-3.5 和 text-davinci-003 均展现出增强的性能。GPT 系列模型展现了相当高的效率,这体现在其成本效益和节省时间的能力上。结论:开发并实施了一个全面的 LLMs 定性性能评估框架。该框架超越了单一的性能层面。借助专家标注,该方法不仅验证了 LLMs 处理复杂医疗数据的能力,还为未来跨专业领域的 LLM 评估确立了基准。
引用
@article{arxiv.2401.13588,
title = {Evaluation of General Large Language Models in Contextually Assessing Semantic Concepts Extracted from Adult Critical Care Electronic Health Record Notes},
author = {Darren Liu and Cheng Ding and Delgersuren Bold and Monique Bouvier and Jiaying Lu and Benjamin Shickel and Craig S. Jabaley and Wenhui Zhang and Soojin Park and Michael J. Young and Mark S. Wainwright and Gilles Clermont and Parisa Rashidi and Eric S. Rosenthal and Laurie Dimisko and Ran Xiao and Joo Heung Yoon and Carl Yang and Xiao Hu},
journal= {arXiv preprint arXiv:2401.13588},
year = {2024}
}