利用基础语言模型(FLMs)从大型 EHR 数据库中自动提取队列
机器学习
2024-12-17 v1 人工智能
摘要
队列研究中的一个关键步骤是从一个或多个研究数据集中提取所需队列。这一步骤非常耗时,尤其是当研究人员面对一个他们以前未曾使用过的数据集时。当必须从多个数据集中提取队列时,队列提取可能极其繁琐。在本研究中,我们提出了一种从多个电子健康记录(EHR)数据库中部分自动化提取队列的方法。我们将引导式多数据集队列提取问题表述为:首先将选择标准转换为查询,将其从自然语言文本翻译为映射到数据库实体的语言。然后,使用 FLMs,在研究数据库之间自动匹配从查询中识别出的目标列。最后,在所有数据库上运行生成的查询以提取研究队列。我们提出并评估了一种在两个大型、流行且公开可访问的 EHR 数据库——MIMIC-III 和 eICU 上自动进行列匹配的算法。我们的方法在使用一个小型预训练通用语言模型时,实现了 92% 的前三准确率,正确匹配了 13 个目标列中的 12 个。此外,即使搜索空间(即数据库大小)增加,该准确率也能保持。
引用
@article{arxiv.2412.11472,
title = {Leveraging Foundation Language Models (FLMs) for Automated Cohort Extraction from Large EHR Databases},
author = {Purity Mugambi and Alexandra Meliou and Madalina Fiterau},
journal= {arXiv preprint arXiv:2412.11472},
year = {2024}
}