使用大型语言模型自动补全电子健康记录中的主诉
计算与语言
2024-01-12 v1 人工智能
机器学习
摘要
主诉 (Chief Complaint, CC) 是患者病历的关键组成部分,因为它描述了寻求医疗护理的主要原因或担忧。它为医疗保健提供者做出有关患者护理的知情决策提供了关键信息。然而,记录 CC 对医疗保健提供者来说可能非常耗时,尤其是在繁忙的急诊科。为了解决这个问题,一个能为临床记录建议准确且格式规范的短语或句子的自动补全工具,对分诊护士来说可能是一种宝贵的资源。在本研究中,我们利用文本生成技术,使用 CC 数据开发了机器学习模型。在我们提出的工作中,我们训练了一个长短期记忆 (LSTM) 模型,并对生物医学生成式预训练 Transformer (BioGPT) 的三种不同变体(即 microsoft/biogpt、microsoft/BioGPT-Large 和 microsoft/BioGPT-Large-PubMedQA)进行了微调。此外,我们通过纳入示例性 CC 句子,利用 GPT-4 的 OpenAI API 来调整提示。我们基于困惑度分数、修改后的 BERTScore 和余弦相似度分数来评估模型性能。结果表明,与其他模型相比,BioGPT-Large 表现出优越的性能。它在生成 CC 时始终如一地实现了 1.65 的极低困惑度分数,而基线 LSTM 模型的最佳困惑度分数为 170。此外,我们评估并评价了所提出模型的性能以及 GPT-4.0 的结果。我们的研究表明,利用诸如 BioGPT 之类的 LLM,可以开发出一种有效的自动补全工具,用于在医疗保健环境中生成 CC 文档。
引用
@article{arxiv.2401.06088,
title = {Autocompletion of Chief Complaints in the Electronic Health Records using Large Language Models},
author = {K M Sajjadul Islam and Ayesha Siddika Nipu and Praveen Madiraju and Priya Deshpande},
journal= {arXiv preprint arXiv:2401.06088},
year = {2024}
}
备注
IEEE BigData 2023 - Sorrento, Italy. 10 Pages, 4 Figures, 5 Tables