FedPS:基于聚合统计信息的联邦数据预处理
机器学习
2026-02-12 v1 人工智能
摘要
联邦学习(FL)使多个方能够在不共享原始数据的情况下协同训练机器学习模型。然而,在训练之前,数据必须进行预处理以处理缺失值、不一致的格式以及异构特征尺度。这种预处理阶段对模型性能至关重要,但在FL研究中基本被忽视。在实际FL系统中,隐私约束禁止集中化原始数据,而通信效率为分布式预处理引入了进一步挑战。我们提出FedPS,一个基于聚合统计信息的联邦数据预处理框架。FedPS利用数据草图技术高效地总结本地数据集,同时保留essential统计信息。基于这些摘要,我们设计了用于特征缩放、编码、离散化和缺失值插值的联邦算法,并将与预处理相关的模型(如k-Means、k近邻和贝叶斯线性回归)扩展到水平和垂直FL设置。FedPS为实际FL部署提供了灵活、通信高效且一致的预处理管道。
引用
@article{arxiv.2602.10870,
title = {FedPS: Federated data Preprocessing via aggregated Statistics},
author = {Xuefeng Xu and Graham Cormode},
journal= {arXiv preprint arXiv:2602.10870},
year = {2026}
}
备注
19 pages