利用语言模型实现自动化患者记录关联
人工智能
2025-04-22 v1 机器学习
摘要
目标:医疗数据碎片化是连接患者数据提出的重大挑战,迫切需要稳健的记录关联以整合来自不同来源的患者记录。本研究探讨了利用语言模型进行自动化患者记录关联的可行性,关注两个关键任务:阻塞和匹配。材料与方法:我们利用来自密苏里癌症登记与研究中心的真实医疗数据,通过概率关联方法作为基准,将来自两个独立来源的患者记录进行关联。对阻塞任务,我们使用句子嵌入对RoBERTa进行微调。对于匹配任务,我们在微调和零样本设置下实验了多种语言模型,评估其性能与真实标签的对比。结果:微调的阻塞模型在保持近乎完美召回率的同时,将候选对数量减少了92%。在匹配任务中,微调的Mistral-7B取得了最佳性能,仅有6个错误预测。在零样本模型中,Mistral-Small-24B表现最佳,总共有55个错误预测。讨论:微调的语言模型在患者记录阻塞和匹配方面实现了强大的性能,错误极少。然而,它们在阻塞方面仍不如基于规则和概率方法的混合方法准确且高效。此外,由于计算成本高昂,像DeepSeek-R1这样的推理模型对于大规模记录关联是不可行的。结论:本研究凸显了语言模型实现自动化患者记录关联的潜力,提高了效率,消除了执行患者记录关联所需的手动工作。这为数据集成、减少手动工作以及支持疾病监测和研究提供了可扩展的解决方案。
引用
@article{arxiv.2504.15261,
title = {Leveraging Language Models for Automated Patient Record Linkage},
author = {Mohammad Beheshti and Lovedeep Gondara and Iris Zachary},
journal= {arXiv preprint arXiv:2504.15261},
year = {2025}
}