中文

EFTViT:基于受掩码图像在资源受限客户端上高效联合训练的视觉变换器

计算机视觉与模式识别 2025-09-03 v2 人工智能

摘要

联合学习研究最近从卷积神经网络(CNN)转向视觉变换器(ViT),因为它们具有更大的表达能力。ViT训练需要更高的计算资源,因为缺乏CNN固有的二维归纳偏置。然而,在资源受限的边缘设备上高效地训练ViT remains unexplored in the community。本文提出EFTViT,一个分层联合框架,利用受掩码图像实现在资源受限边缘设备上的高效、完整参数训练,为学习异构数据提供了显著优势。总体而言,我们对图像进行分块并随机掩盖部分块,发现排除这些块对性能影响最小,同时大幅降低计算成本并增强数据内容隐私保护。具体而言,EFTViT由一系列轻量级本地模块和一个较大的全局模块组成,分别在客户端和中央服务器上独立更新。本地模块在掩码图像块上训练,而全局模块在来自本地客户端的中间块特征上训练,通过提出的中位数抽样策略进行平衡,以消除客户端数据分布的隐私。我们分析了EFTViT的计算复杂度和隐私保护能力。大量实验表明,与现有方法相比,EFTViT在准确率上提升了最高可达28.17%,本地训练计算成本降低最高可达2.8倍,训练时间缩短最高可达4.4倍。

关键词

引用

@article{arxiv.2412.00334,
  title  = {EFTViT: Efficient Federated Training of Vision Transformers with Masked Images on Resource-Constrained Clients},
  author = {Meihan Wu and Tao Chang and Cui Miao and Jie Zhou and Chun Li and Xiangyu Xu and Ming Li and Xiaodong Wang},
  journal= {arXiv preprint arXiv:2412.00334},
  year   = {2025}
}