中文

基于本体与 LLM 的医疗联邦学习数据协调

机器学习 2025-05-27 v1 软件工程

摘要

电子健康记录(EHRs)的兴起为医学研究解锁了新的机遇,但隐私法规和数据异构性仍是大规模机器学习的关键障碍。联邦学习(FL)能够在不共享原始数据的情况下进行协作建模,但在协调多样化临床数据集方面仍面临挑战。本文提出了一种整合本体和大型语言模型(LLMs)的两步数据对齐策略,以支持医疗领域中安全且保护隐私的联邦学习,并在一个涉及 EHR 数据语义映射的真实世界项目中证明了其有效性。

关键词

引用

@article{arxiv.2505.20020,
  title  = {Ontology- and LLM-based Data Harmonization for Federated Learning in Healthcare},
  author = {Natallia Kokash and Lei Wang and Thomas H. Gillespie and Adam Belloum and Paola Grosso and Sara Quinney and Lang Li and Bernard de Bono},
  journal= {arXiv preprint arXiv:2505.20020},
  year   = {2025}
}

备注

Related dataset: https://doi.org/10.5281/zenodo.15411810