面向医学 OSCE 评估的大语言模型:基于 transcript 分析的新方法
计算与语言
2024-10-18 v1 人工智能
摘要
对客观结构临床考试 (OSCE) 的评分是一个耗时且昂贵的过程,传统上需要来自人类专家的大量手动工作。在本研究中,我们探索了大语言模型 (LLM) 评估与医学生沟通技能相关的潜力。我们分析了来自 University of Texas Southwestern Medical Center (UTSW) 的 2,027 份录像 OSCE 考试记录,涵盖四年间 (2019-2022),以及不同的医疗案例或“站点”。具体而言,我们的重点是评估学生总结患者病历史的能力:我们聚焦于沟通技能评分标准中的项目“学生是否总结了患者的病历史?”。在使用 Whisper-v3 对 OSCE 视频中捕获的语音进行转录后,我们研究了各种基于 LLM 的方法,针对基于其考试 transcript 的总结任务对学生进行评分。我们评估了各种前沿级开源和专有 LLM,评估了零-shot 链式思维提示、检索增强生成和多模型集成方法等不同技术。我们的结果表明,像 GPT-4 这样的前沿 LLM 模型在与人类评分员一致性方面取得了惊人的成果,达到 0.88 的 Cohen's kappa 一致性,表明 LLM 基于的 OSCE 评分在增强当前评分流程方面具有强大的潜力。开源模型也显示出有前景的成果,表明其在大规模、成本效益高的部署方面具有潜力。此外,我们提出了一项失效分析,识别 LLM 在此背景下评估可能不够可靠的情形,并为在医疗教育环境中部署 LLM 提供了最佳实践建议。
引用
@article{arxiv.2410.12858,
title = {Large Language Models for Medical OSCE Assessment: A Novel Approach to Transcript Analysis},
author = {Ameer Hamza Shakur and Michael J. Holcomb and David Hein and Shinyoung Kang and Thomas O. Dalton and Krystle K. Campbell and Daniel J. Scott and Andrew R. Jamieson},
journal= {arXiv preprint arXiv:2410.12858},
year = {2024}
}