联邦学习中的多模态 Transformer 探索
计算机视觉与模式识别
2024-07-18 v2 机器学习
摘要
多模态 Transformer 在不同领域标志着重大进展,但孤岛式的高质量数据阻碍了其进一步提升。为解决这一问题,联邦学习 (FL) 作为一种有前景的隐私保护范式出现,无需直接访问不同客户端持有的原始数据即可训练模型。尽管具有潜力,但关于 FL 中未配对单模态客户端和 Transformer 架构的重要研究方向仍未被探索。为填补这一空白,本文探索了视觉-语言领域内的迁移多模态联邦学习 (MFL) 场景,其中客户端拥有分布在不同数据集中的多种模态数据。我们系统评估了利用 Transformer 架构时现有方法的性能,并通过解决客户端之间的模态内和跨模态差距,引入了一个名为联邦模态互补与协作 (FedCola) 的新框架。通过在各种 FL 设置下的广泛实验,FedCola 展示了优于先前方法的性能,为未来多模态 Transformer 的联邦训练提供了新视角。
引用
@article{arxiv.2404.12467,
title = {Towards Multi-modal Transformers in Federated Learning},
author = {Guangyu Sun and Matias Mendieta and Aritra Dutta and Xin Li and Chen Chen},
journal= {arXiv preprint arXiv:2404.12467},
year = {2024}
}
备注
2024 European Conference on Computer Vision (ECCV)