中文

大语言模型在医学领域训练的联邦与参数高效框架

计算与语言 2026-01-30 v1 分布式、并行与集群计算

摘要

大语言模型(LLMs)在医学基准测试中展现出强大的性能,包括问答和诊断。为使其在临床环境中应用,通常通过使用临床数据进行继续预训练或后训练来适应。然而,大多数医学LLMs是在单一机构的数据上训练的,这在通用性和异构系统的安全性方面存在局限。联邦学习(FL)是一种在医疗机构之间启用协作模型开发的有前景的解决方案。然而,将FL应用于医学LLMs仍存在根本性限制。首先,传统FL要求在每个通信轮次中传输完整模型,对于多数十亿参数的LLMs而言,在有限的计算资源下是不可行的。其次,许多FL算法隐式假设数据具有同质性,而真实世界的临床数据在患者、疾病和机构实践方面高度异构。我们引入面向医学应用的模型无关且参数高效的联邦学习框架。Fed-MedLoRA仅传输低秩适配器参数,显著减少通信和计算开销,而Fed-MedLoRA+进一步采用自适应、数据感知的聚合以提高跨站异构情形下的收敛性。我们将该框架应用于临床信息抽取(IE),即将患者叙述转化为结构化医疗实体和关系的过程。通过与BERT模型、LLaMA-3和DeepSeek-R1、GPT-4o模型进行比较,评估了准确率。评估设置包括(1)领域内训练和测试,(2)独立队列的外部验证,(3)使用真实世界临床记录的低资源新站适应情形,来自Yale New Haven Health System。

关键词

引用

@article{arxiv.2601.22124,
  title  = {A Federated and Parameter-Efficient Framework for Large Language Model Training in Medicine},
  author = {Anran Li and Yuanyuan Chen and Wenjun Long and Yu Yin and Yan Hu and Hyunjae Kim and Weipeng Zhou and Yujia Zhou and Hongyi Peng and Yang Ren and Xuguang Ai and Zhenyue Qin and Ming Hu and Xiaoxiao Li and Han Yu and Yih-Chung Tham and Lucila Ohno-Machado and Hua Xu and Qingyu Chen},
  journal= {arXiv preprint arXiv:2601.22124},
  year   = {2026}
}

备注

38 pages, 9 tables, 3 figures