EHRmonize:基于大语言模型的电子健康记录医学概念抽象框架
计算与语言
2024-07-02 v1
摘要
电子健康记录(EHR)包含大量复杂数据,但对这些信息进行统一化和处理仍是一个具有挑战性且成本高昂的任务,需要大量临床专业知识。虽然大语言模型(LLM)在various healthcare applications中显示出前景,但其从EHR中抽象医学概念的潜力仍基本未被探索。我们介绍EHRmonize,一个利用LLM从EHR数据中抽象医学概念的框架。我们的研究使用来自两个真实EHR数据库的药物数据,对五种LLM在两个自由文本提取任务和六个二元分类任务上进行评估,涵盖various prompting strategies。GPT-4o的10-shot prompting在所有任务中取得了最佳性能,Claude-3.5-Sonnet在一部分任务中也表现出色。GPT-4o在识别通用给药方式时达到97%的准确率,对通用药物名称达到82%准确率,并在抗生素的二元分类中实现100%准确率。虽然EHRmonize显著提高了效率,估计减少了60%的标注时间,但我们强调,临床医生的监督仍是必需的。我们的框架作为Python软件包提供,为临床医生在EHR数据抽象方面提供了一个有前景的工具, potentially加速 healthcare research and improve data harmonization processes.
引用
@article{arxiv.2407.00242,
title = {EHRmonize: A Framework for Medical Concept Abstraction from Electronic Health Records using Large Language Models},
author = {João Matos and Jack Gallifant and Jian Pei and A. Ian Wong},
journal= {arXiv preprint arXiv:2407.00242},
year = {2024}
}
备注
submitted for review, total of 10 pages