中文

面向标签稀缺单类目分类的自监督异构数据联邦学习

计算机视觉与模式识别 2026-04-01 v1

摘要

标签稀缺的视觉分类在非中心化和异构数据下是模式识别中的基本挑战,尤其当各站点 exhibits 部分重叠的类别集合时。虽然自监督联邦学习(SSFL)提供了一个有前景的解决方案,但现有研究通常假设 pre-training 和 fine-tuning 时的数据异构性模式相同。此外,当前的分区方案往往无法生成纯粹的部分类别不相连的数据设置,这限制了对真实世界标签空间异构性的可控模拟。在本工作中,我们以单类目分类为代表的真实世界实例,系统性地研究了 stage-specific 数据异构性。我们研究了 pre-training 中 unlabeled 数据量的 site 间变异以及 downstream fine-tuning 中标签空间错位。为在可控设置下研究后者,我们提出 PreDi—a 分区方案将标签空间异构性解耦为两个正交维度,即类别 Prevalence 和类别集合大小 Disparity,使我们能够单独分析它们的影响。基于所得见解,我们进一步提出 PreP-WFL(基于 Prevalence 的个人化加权联邦学习)以适应低 Prevalence 场景中稀有类的表征。广泛的实验表明,SSFL 在 homogeneous 和 heterogeneous 设置下均优于 local-only 训练。未标记数据量的显著异构性与 improved representation pre-training 相关联,而在标签空间异构性下,Prevalence 主导性能且 Disparity 的影响较小。PreP-WFL 有效缓解了这种降解,随着 Prevalence 的降低而增益增加。这些发现为表征去中心化识别系统中的标签空间异构性提供了机制依据。

关键词

引用

@article{arxiv.2603.29633,
  title  = {Self-Supervised Federated Learning under Data Heterogeneity for Label-Scarce Diatom Classification},
  author = {Mingkun Tan and Xilu Wang and Michael Kloster and Tim W. Nattkemper},
  journal= {arXiv preprint arXiv:2603.29633},
  year   = {2026}
}

备注

22 pages, 9 figures