基于视觉大语言模型的医学数据多模态单样本联邦集成学习
机器学习
2025-01-08 v1 人工智能
摘要
联邦学习因其在保持数据隐私的同时促进协作模型训练的能力,在医疗领域引起了广泛关注。然而,传统联邦学习方法通常需要多轮通信,导致显著的通信开销和延迟,在带宽有限的环境中尤为突出。单样本联邦学习通过在单轮通信中完成模型训练和聚合来解决这些问题,从而在保护隐私的同时降低通信成本。其中,单样本联邦集成学习利用投票等集成技术结合独立训练的客户端模型,进一步提升了在非独立同分布数据场景下的性能。另一方面,现有的医疗机器学习方法主要使用单模态数据(如医学图像或文本报告),这限制了其诊断准确性和全面性。因此,本文提出整合多模态数据以解决这些缺陷。我们提出了 FedMME,这是一个创新的单样本多模态联邦集成学习框架,利用多模态数据进行医学图像分析。具体而言,FedMME 利用视觉大语言模型从医学图像生成文本报告,采用 BERT 模型从这些报告中提取文本特征,并将这些特征与视觉特征融合以提高诊断准确率。实验结果表明,在具有不同数据分布的四个数据集上,我们的方法在医疗场景中相比现有的单样本联邦学习方法表现出更优的性能。例如,在应用 Dirichlet 分布( = 0.3)的 RSNA 数据集上,其准确率比现有的单样本联邦学习方法高出 17.5% 以上。
引用
@article{arxiv.2501.03292,
title = {Multi-Modal One-Shot Federated Ensemble Learning for Medical Data with Vision Large Language Model},
author = {Naibo Wang and Yuchen Deng and Shichen Fan and Jianwei Yin and See-Kiong Ng},
journal= {arXiv preprint arXiv:2501.03292},
year = {2025}
}