基于样本级非独立同分布数据的联邦 XGBoost
机器学习
2022-09-07 v1 人工智能
摘要
联邦学习(FL)是一种以去中心化方式联合训练机器学习算法的范式,允许各方与聚合器通信以创建和训练模型,而无需暴露参与训练过程的本地方的底层原始数据分布。FL 中大多数研究集中于基于神经网络的方法,然而由于克服算法迭代与累加特性的挑战,基于树的方法(如 XGBoost)在联邦学习中未被充分探索。基于决策树的模型,特别是 XGBoost,可处理非独立同分布(non-IID)数据,这对于联邦学习框架中使用的算法意义重大,因为数据的底层特征本身是去中心化的,且天然存在非 IID 风险。本文我们通过在不同基于样本量的数据偏斜场景上实验,重点研究联邦 XGBoost 如何受非 IID 分布影响,以及这些模型在各种非 IID 场景下的表现。我们在多个不同数据集与不同数据偏斜划分上进行了大量实验。实验结果表明,尽管划分比例各异,模型性能保持一致,并与集中式训练的模型表现接近或同等良好。
引用
@article{arxiv.2209.01340,
title = {Federated XGBoost on Sample-Wise Non-IID Data},
author = {Katelinh Jones and Yuya Jeremy Ong and Yi Zhou and Nathalie Baracaldo},
journal= {arXiv preprint arXiv:2209.01340},
year = {2022}
}
备注
9 Pages, 1 figure, 3 tables