中文

FedPS:基于聚合统计信息的联邦数据预处理

机器学习 2026-02-12 v1 人工智能

摘要

联邦学习(FL)使多个方能够在不共享原始数据的情况下协同训练机器学习模型。然而,在训练之前,数据必须进行预处理以处理缺失值、不一致的格式以及异构特征尺度。这种预处理阶段对模型性能至关重要,但在FL研究中基本被忽视。在实际FL系统中,隐私约束禁止集中化原始数据,而通信效率为分布式预处理引入了进一步挑战。我们提出FedPS,一个基于聚合统计信息的联邦数据预处理框架。FedPS利用数据草图技术高效地总结本地数据集,同时保留essential统计信息。基于这些摘要,我们设计了用于特征缩放、编码、离散化和缺失值插值的联邦算法,并将与预处理相关的模型(如k-Means、k近邻和贝叶斯线性回归)扩展到水平和垂直FL设置。FedPS为实际FL部署提供了灵活、通信高效且一致的预处理管道。

关键词

引用

@article{arxiv.2602.10870,
  title  = {FedPS: Federated data Preprocessing via aggregated Statistics},
  author = {Xuefeng Xu and Graham Cormode},
  journal= {arXiv preprint arXiv:2602.10870},
  year   = {2026}
}

备注

19 pages