中文

基于多模态原型的开放词汇联邦学习

计算与语言 2024-04-03 v2 计算机视觉与模式识别

摘要

现有的联邦学习(FL)研究通常假设训练标签空间和测试标签空间相同。然而,在实际应用中,这一假设过于理想化。新用户可能提出涉及未见类别数据的查询,这种开放词汇查询会直接破坏此类FL系统。因此,本文明确关注FL中尚未充分探索的开放词汇挑战。即,对于新用户,全局服务器应理解其涉及任意未知类别的查询。为解决此问题,我们利用预训练的视觉语言模型(VLM)。具体而言,我们提出了一种针对FL中VLM的新型自适应框架,称为联邦多模态原型(Fed-MP)。Fed-MP基于轻量级客户端残差自适应聚合本地模型权重,并基于新颖的多模态原型机制进行预测。Fed-MP利用从已见类别中学到的知识,使自适应后的VLM对未见类别具有鲁棒性。我们在各种数据集上的实证评估验证了Fed-MP的有效性。

关键词

引用

@article{arxiv.2404.01232,
  title  = {Open-Vocabulary Federated Learning with Multimodal Prototyping},
  author = {Huimin Zeng and Zhenrui Yue and Dong Wang},
  journal= {arXiv preprint arXiv:2404.01232},
  year   = {2024}
}

备注

Accepted at NAACL 2024