利用大语言模型支持生物医学数据协调的自然语言处理方法
计算与语言
2024-11-06 v1 机器学习
摘要
生物医学研究需要大规模、多样化的样本以产生无偏结果。跨数据集自动匹配变量的方法可以加速这一过程。该领域的研究一直较为有限,主要聚焦于词汇匹配和基于本体的语义匹配。我们旨在开发利用大语言模型(LLM)和集成学习来自动化变量匹配的新方法。方法:我们利用两个 GERAS 队列研究(欧洲和日本)的数据来开发变量匹配方法。我们首先通过将 352 个 EU 变量与 1322 个候选 JP 变量进行手动匹配,构建了一个数据集,其中匹配的变量对为正例,未匹配的对为负例。利用该数据集,我们开发并评估了两类自然语言处理方法:(1)基于 LLM 的方法和(2)模糊匹配方法。随后,我们开发了一种基于随机森林(Random Forest)模型的集成学习方法,将各 NLP 方法进行整合。RF 在 50 次试验中进行了训练和评估。每次试验采用随机划分(4:1)的训练集和测试集,模型超参数通过训练集上的交叉验证进行优化。对于每个 EU 变量,根据 NLP 导出的相似度分数或 RF 的概率分数,对 1322 个候选 JP 变量进行排序,以表示其与 EU 变量匹配的可能性。排序性能通过 top-n 命中率(HRn)和平均倒数排名(MRR)进行衡量。结果:E5 在各单独方法中表现最佳,取得了 0.90 HR-30 和 0.70 MRR。RF 在所有指标上均优于 E5(),平均取得了 0.98 的 HR-30 和 0.73 的 MRR。LLM 导出的特征对 RF 性能的贡献最大。自动变量匹配中错误的一个主要原因是数据字典中变量定义的模糊性。
引用
@article{arxiv.2411.02730,
title = {A Natural Language Processing Approach to Support Biomedical Data Harmonization: Leveraging Large Language Models},
author = {Zexu Li and Suraj P. Prabhu and Zachary T. Popp and Shubhi S. Jain and Vijetha Balakundi and Ting Fang Alvin Ang and Rhoda Au and Jinying Chen},
journal= {arXiv preprint arXiv:2411.02730},
year = {2024}
}
备注
32 pages, 2 figures