中文

提升联邦域泛化能力:高级预训练架构的作用

计算机视觉与模式识别 2024-09-27 v3

摘要

本研究探讨了先进的预训练架构,如 Vision Transformer (ViT)、ConvNeXt 和 Swin Transformer 在增强联邦域泛化方面的效能。这些架构捕获全局情境特征和建模长程依赖,因而是提高跨域泛化的有前景的候选方案。我们进行广泛的研究,进行深入分析,系统评估了这些架构的不同变体,使用广泛的预训练数据集,如 ImageNet-1K、ImageNet-21K、JFT-300M 和 ImageNet-22K。此外,我们比较了自监督和监督预训练策略以评估其对 FDG 性能的影响。我们的发现表明,自监督技术(即聚焦于重建被遮盖图像块)能够更好地捕获图像的内在结构,从而优于其监督对等方案。针对 Office-Home 和 PACS 数据集的全面评估表明,采用预训练于更大数据集的高级架构建立了新的基准,分别实现了 84.46% 和 92.55% 的平均准确率。此外,我们注意到某些高级模型变体尽管参数更少,却优于更大的 ResNet 模型。这一发现突显了利用精细架构和多样化预训练策略以增强 FDG 性能的关键作用,尤其是在计算资源有限的场景下,模型效率至关重要。我们的结果表明,联邦学习系统可通过利用这些先进方法变得更具可适应性和效率,为未来 FDG 研究提供了有价值的见解。

关键词

引用

@article{arxiv.2409.13527,
  title  = {Boosting Federated Domain Generalization: Understanding the Role of Advanced Pre-Trained Architectures},
  author = {Avi Deb Raha and Apurba Adhikary and Mrityunjoy Gain and Yu Qiao and Choong Seon Hong},
  journal= {arXiv preprint arXiv:2409.13527},
  year   = {2024}
}