利用文本语义增强视觉表征:面向异构联邦学习的文本语义驱动原型
机器学习
2026-04-20 v2 人工智能
摘要
联邦原型学习(FedPL)已成为处理联邦学习(FL)中数据异构性的有效策略。在 FedPL 中,客户端协作构建一组全局特征中心(原型),并使本地特征与这些原型对齐,以缓解数据异构性影响。FedPL 的性能高度依赖于原型质量。现有方法假设原型之间的更大类别间距离可提升性能,因而设计不同方法以增加这些距离。然而,我们注意到,这些方法虽然通过增加原型距离来增强类别判别力,却不可避免地破坏了类别之间至关重要的语义关系,而这些关系对模型泛化至关重要。这引出一个重要问题:如何构建在本质上保留类别之间语义关系的原型?直接从有限且异构的客户端数据中学习这些关系在 FL 场景下具有挑战。最近,预训练语言模型(PLMs)的成功表明其能够从海量文本语料库中捕获语义关系。基于此,我们提出 FedTSP,一种利用 PLMs 从文本模态构建语义丰富原型的新方法,使异构数据设置下的协作更加高效。我们首先使用大型语言模型(LLM)为每个类别生成细粒度文本描述,然后由 PLM 在服务器端处理以形成文本原型。为解决客户端图像模型与 PLM 之间的模态鸿沟,我们引入可训练提示符,使原型能够更好地适应客户端任务。广泛实验表明,FedTSP 在缓解数据异构性方面具有显著效果,并显著加快收敛速度。
引用
@article{arxiv.2503.13543,
title = {Enhancing Visual Representation with Textual Semantics: Textual Semantics-Powered Prototypes for Heterogeneous Federated Learning},
author = {Xinghao Wu and Jianwei Niu and Xuefeng Liu and Guogang Zhu and Jiayuan Zhang and Shaojie Tang and Wei Chen},
journal= {arXiv preprint arXiv:2503.13543},
year = {2026}
}
备注
Accepted by CVPR 2026 (Highlight)