定制开源大语言模型以跨异构电子健康记录系统进行定量药物属性提取
摘要
协调不同电子健康记录系统中的用药数据一直是监测阿片类药物使用障碍用药的持续障碍。在异构的电子健康记录系统中,关键的处方属性分散在不同格式的字段和自由文本记录中。我们提出了一个实用框架,该框架定制了开源大语言模型(包括Llama、Qwen、Gemma和MedGemma),以从异构的、特定站点的数据中提取统一的阿片类药物使用障碍处方属性集(处方日期、药物名称、用药时长、总剂量、每日剂量和续药次数),并计算每位患者标准化的用药覆盖指标——阿片类药物使用障碍用药天数。我们的流水线直接在固定的JSON模式中处理记录,随后进行轻量级归一化和跨字段一致性检查。我们使用来自一项全国性阿片类药物使用障碍研究中五个诊所的处方级电子健康记录数据(来自1257名患者的25605条记录)对该系统进行了评估,并以先前标注的10369条记录(776名患者)基准作为真值。性能以覆盖率(具有有效、可匹配输出的记录占比)和记录级精确匹配准确率报告。较大的模型整体表现最佳:Qwen2.5-32B在诊所间实现了93.4%的覆盖率和93.0%的精确匹配准确率,MedGemma-27B达到了93.1%/92.2%。简要的错误审查突出了三个常见问题及修复方法:使用药物内规范填补缺失的剂量字段、处理每月/每周注射剂(如Vivitrol)时根据记录的时间表设置用药时长、以及添加单位检查以防止质量单位(如“250 g”)被误读为每日计数。通过消除脆弱的、特定站点的ETL并支持本地化、保护隐私的部署,该方法能够在真实世界环境中实现跨站点一致的阿片类药物使用障碍用药暴露、依从性和保留率分析。
引用
@article{arxiv.2510.21027,
title = {Customizing Open Source LLMs for Quantitative Medication Attribute Extraction across Heterogeneous EHR Systems},
author = {Zhe Fei and Mehmet Yigit Turali and Shreyas Rajesh and Xinyang Dai and Huyen Pham and Pavan Holur and Yuhui Zhu and Larissa Mooney and Yih-Ing Hser and Vwani Roychowdhury},
journal= {arXiv preprint arXiv:2510.21027},
year = {2025}
}
备注
NeurIPS 2025: The Second Workshop on GenAI for Health: Potential, Trust, and Policy Compliance