面向资源高效异构医学图像分类的联邦CLIP
计算机视觉与模式识别
2025-11-12 v1
摘要
尽管深度模型在医学影像方面取得了显著的性能,但它们仍需要源数据进行训练,这受到了隐私关注的限制。联邦学习(FL)作为一种 decentralized学习框架,可使用多个医院(即FL客户端)训练共享模型,提供了可行的解决方案。然而,数据异构性和资源成本阻碍了FL模型的部署,尤其是在使用视觉语言模型(VLM)时。为此,我们提出一种基于对比语言-图像预训练(CLIP)的FL方法,用于医学图像分类(FedMedCLIP)。具体而言,我们引入掩码特征适应模块(FAM)作为通信模块,以减少通信负载,同时冻结CLIP编码器以降低计算开销。此外,我们提出掩码多层感知机(MLP)作为私有local分类器,以适应客户端任务。进一步,我们设计一种基于自适应KL散度的蒸馏正则化方法,以实现FAM与MLP之间的相互学习。最后,我们采用模型压缩技术传输FAM参数,同时使用ensemble预测进行分类。在四个公开医学数据集上的大量实验表明,我们的模型在合理的资源成本下(例如相较于FedAVG快120倍)提供了可行的性能(例如在ISIC2019上比第二名baseline高出8%)。
引用
@article{arxiv.2511.07929,
title = {Federated CLIP for Resource-Efficient Heterogeneous Medical Image Classification},
author = {Yihang Wu and Ahmad Chaddad},
journal= {arXiv preprint arXiv:2511.07929},
year = {2025}
}
备注
Accepted in AAAI 2026 Main track. Code is available at https://github.com/AIPMLab/FedMedCLIP