中文

面向联邦随机森林的协同集成构建方法

机器学习 2024-07-30 v1 人工智能 密码学与安全 分布式、并行与集群计算

摘要

随机森林因其鲁棒性和多功能性被认为是机器学习中的基石。尽管具有这些优势,但其传统的集中训练方式不适用于数据往往是分布式、敏感且存在隐私顾虑的现代环境。联邦学习(FL)提供了有力的解决方案,使模型能够在保持每个客户数据隐私的前提下进行训练。然而,将基于树的方法(如随机森林)适应联邦环境引入了诸多挑战,尤其是当客户端之间数据分布不一致(non-IID)时,这在现实应用中很常见。本文提出一种联邦随机森林方法,采用新颖的集成构建方法以提高非IID数据下的性能。与在每个客户端独立生长树不同,我们的方法确保ensemble中的每个决策树都在客户端之间进行迭代和集体生长。为了维护客户端数据的隐私,我们将叶子节点中存储的信息限制为来自客户端本地数据到达每个节点的样本所识别的多数类标签。这种有限的披露保留了客户端数据分布的保密性,从而增强了联邦学习过程的隐私性。此外,我们的协同集成构建策略使ensemble更能反映不同客户端之间数据异构性,提高了在非IID数据上的性能,实验结果证明了这一点。

关键词

引用

@article{arxiv.2407.19193,
  title  = {A collaborative ensemble construction method for federated random forest},
  author = {Penjan Antonio Eng Lim and Cheong Hee Park},
  journal= {arXiv preprint arXiv:2407.19193},
  year   = {2024}
}

备注

This is the authors' accepted manuscript of an article published in the journal Expert Systems With Applications. Published version available at: https://www.sciencedirect.com/science/article/pii/S0957417424016099. 22 pages, 3 figures