中文

入学与参与选择偏差下的联邦学习

机器学习 2026-04-30 v1

摘要

联邦学习(FL)从分布式客户端处训练共享模型,常隐含假设Contributing clients(贡献客户端)代表目标人口。在实践中,这一代表性假设可能在两个不同阶段失败,导致选择偏差。首先, eligibility 规则(如设备限制、软件要求或用户同意)决定了哪些客户端被录取并可被训练,从而导致 \emph{入学偏差}。其次,在已录取的客户端中,用户和系统因素(如电池状态、网络状态和本地时间)决定了哪些客户端在每个通信轮次中参与,从而导致 \emph{参与偏差}。尽管现有工作在解决轮级参与偏差方面取得了一些进展,但对 population-level 入学偏差的关注极少,这会导致训练目标与目标人口目标之间的持续性不匹配。我们在两个阶段选择模型下形式化 FL,推导 \textsc{FedIPW}——一种逆概率加权聚合方案,可在标准的 ignorability(可忽略性)和 positivity(正性)假设下恢复目标人口均值更新。由于客户端级别的协变量对于非录取客户端往往不可得,我们还引入一种有限信息聚合校准扩展,利用已知目标人口概述来对已录取样本进行加权,从而部分纠正入学偏差。我们进一步提供一种算法无关的优化分析,讨论残余加权误差并指出不完全选择纠正可能导致非消失偏差底峰。最后,合成联邦逻辑回归实验验证了预测的目标不匹配,并表明入学校正可在两个阶段选择下降低目标人口误差。

关键词

引用

@article{arxiv.2604.26604,
  title  = {Who Trains Matters: Federated Learning under Enrollment and Participation Selection Biases},
  author = {Gota Morishita},
  journal= {arXiv preprint arXiv:2604.26604},
  year   = {2026}
}

备注

10 pages, 2 figures