基于大语言模型的 NIH 常用数据元素规范化工具——CDEMapper
信息检索
2024-12-03 v1
摘要
常用数据元素(CDE)通过标准化数据收集和共享来增强数据互操作性,提高研究可重复性。然而,由于 CDE 的范围广泛且种类多样,其实际落地存在诸多挑战。本研究旨在开发一种有效且高效的映射工具,以弥合本地数据元素与国家卫生研究院(NIH)CDE 之间的差距。我们提出 CDEMapper,一个由大语言模型(LLM)驱动的映射工具,旨在协助将本地数据元素映射到 NIH CDE。CDEMapper 包含三个核心模块:(1)CDE 索引与嵌入。对 NIH CDE 进行索引和嵌入,以支持语义搜索;(2)CDE 推荐。该工具将 Elasticsearch(BM25 相似性方法)与最先进的 GPT 服务结合,以推荐候选 CDE 及其可接受值;(3)人工审核。用户审阅并选择最符合其数据元素和值集的 NIH CDE 和值。我们对该工具的推荐准确性进行了评估,方法是与手动标注的映射结果进行比较。CDEMapper 提供了一个公开的、由 LLM 提供支持的用户友好界面,将必需且先进的映射服务整合到简洁的管道中。它为数据元素与 NIH CDE 对齐提供了分步、经过质量把关的映射工作流程,注重以用户为中心的设计。评估结果表明, 将 GPT 嵌入与 BM25 排序器相结合,能在四个评估数据集中的三个映射场景下持续提高 CDEMapper 的映射准确性。该工作开拓了利用 LLM 辅助 CDE 推荐和人工审核以对齐本地数据元素与 NIH CDE 的潜力。此外,该努力增强了临床研究数据的互操作性,帮助研究人员更好地理解本地数据元素与 NIH CDE 之间的差距。
引用
@article{arxiv.2412.00491,
title = {CDEMapper: Enhancing NIH Common Data Element Normalization using Large Language Models},
author = {Yan Wang and Jimin Huang and Huan He and Vincent Zhang and Yujia Zhou and Xubing Hao and Pritham Ram and Lingfei Qian and Qianqian Xie and Ruey-Ling Weng and Fongci Lin and Yan Hu and Licong Cui and Xiaoqian Jiang and Hua Xu and Na Hong},
journal= {arXiv preprint arXiv:2412.00491},
year = {2024}
}
备注
11 pages,4 figures