中文

在小规模非独立同分布客户端数据集上的双编码模型联邦训练

机器学习 2023-04-12 v2 计算机视觉与模式识别

摘要

对一对输入进行编码的双编码模型被广泛用于表示学习。许多方法通过在集中式训练数据上最大化编码对之间的一致性来训练双编码模型。然而,在许多场景中,由于隐私问题,数据集天然分散在众多客户端(用户设备或组织)中,从而催生了联邦学习。本工作中,我们关注由许多小规模、非IID(独立同分布)客户端数据集组成的分散数据上双编码模型的联邦训练。我们表明,在集中式设定下表现良好的现有方法,当使用联邦平均朴素地适配该设定时表现糟糕。我们观察到,对于基于编码统计量的损失函数,我们可以在单个客户端上模拟大批量损失计算。基于该见解,我们提出了一种新颖的联邦训练方法——分布式互相关优化(DCCO),其利用跨客户端聚合的编码统计量训练双编码模型,而不共享个体数据样本。我们在两个数据集上的实验结果表明,所提DCCO方法大幅优于现有方法的联邦变体。

关键词

引用

@article{arxiv.2210.00092,
  title  = {Federated Training of Dual Encoding Models on Small Non-IID Client Datasets},
  author = {Raviteja Vemulapalli and Warren Richard Morningstar and Philip Andrew Mansfield and Hubert Eichner and Karan Singhal and Arash Afkanpour and Bradley Green},
  journal= {arXiv preprint arXiv:2210.00092},
  year   = {2023}
}

备注

ICLR 2023 Workshop on Pitfalls of Limited Data and Computation for Trustworthy ML