面向安全分布式机器学习的联邦随机森林方案
机器学习
2025-07-23 v1
摘要
隐私和监管障碍常常阻碍集中式机器学习解决方案,尤其是在数据无法自由共享的领域,如医疗保健。联邦学习已成为解决这些问题的强大范式;然而,现有框架主要支持基于梯度的模型,留下了对更具可解释性、基于树的方法的空白。本文引入了一个用于随机森林分类器的联邦学习框架,能够保持数据隐私并在分布式环境中提供稳健的性能。通过利用 PySyft 实现安全、隐私敏感的计算,该方法使多个机构能够在不暴露敏感信息的前提下,针对本地存储的数据协作训练随机森林模型。该框架支持加权模型平均以考虑数据分布的差异,支持增量学习以逐步细化模型,支持本地评估以衡量异构数据集上的性能。在两个真实世界的医疗保健基准测试实验中,结果表明联邦方法在保持竞争性预测准确率方面表现出色——与集中方法相比,最大误差仅为 9%——同时满足严格的隐私要求。这些发现凸显了基于树的联邦学习在数据因监管、竞争或技术限制而无法集中化的场景中的可行性。该解决方案填补了现有联邦学习库之间的显著空白,为需要透明性和可靠性能的安全分布式机器学习任务提供了一个灵活的工具。该工具可在 https://github.com/ieeta-pt/fed_rf 上获取。
引用
@article{arxiv.2505.08085,
title = {A Federated Random Forest Solution for Secure Distributed Machine Learning},
author = {Alexandre Cotorobai and Jorge Miguel Silva and Jose Luis Oliveira},
journal= {arXiv preprint arXiv:2505.08085},
year = {2025}
}