MedPromptExtract(医疗数据提取工具):基于 NLP 与提示工程的匿名化与高保真自动数据提取
人工智能
2024-09-09 v3 信息检索
摘要
引言:数据从来源如出院概要(DS)中提取具有劳动密集型,对于低中收入国家(LMICs)的数字化医疗记录构成重大障碍。本文提出一种完全自动化的方法 MedPromptExtract,用于高效提取 DS 中的数据,同时保持保密性。方法:数据来源为孕妇肾损伤(AKI)患者的出院概要(DS),来自 Kokilaben Dhirubhai Ambani 医院(KDAH)。采用已有工具 EIGEN 进行半监督学习,以实现高保真信息提取进行匿名化处理,使用自然语言处理(NLP)从常规字段中提取数据。我们采用提示工程和大语言模型(LLM)从描述患者住院情况的自由文本中提取定制临床信息。提取与 AKI 发生相关的十二个特征。LLM 响应经临床医生注释验证。结果:MedPromptExtract 工具首先将 DS 送入匿名化管道,耗时约 3 秒/份概要。匿名化经临床医生验证后,NLP 管道以每份概要 0.2 秒的速度从匿名化 PDF 中提取结构化文本,准确率为 100%。最后使用 Gemini Pro 分析这十二个特征。通过将模型响应与临床医生注释进行比较计算准确度指标,七个特征的 AUC 均超过 0.9,表明提取过程具有高保真度。结论:MedPromptExtract 作为一种自动化、可适应的工具,可高效地从医疗记录中提取数据,具有动态用户界面。
引用
@article{arxiv.2405.02664,
title = {MedPromptExtract (Medical Data Extraction Tool): Anonymization and Hi-fidelity Automated data extraction using NLP and prompt engineering},
author = {Roomani Srivastava and Suraj Prasad and Lipika Bhat and Sarvesh Deshpande and Barnali Das and Kshitij Jadhav},
journal= {arXiv preprint arXiv:2405.02664},
year = {2024}
}