联邦森林
机器学习
2020-05-19 v1 机器学习
摘要
大多数现实世界数据分散在不同的公司或政府组织中,受欧盟《通用数据保护条例》(GDPR)和中国《网络安全法》等数据隐私及相关法规限制,难以轻易整合。这种数据孤岛状况以及数据隐私与安全是人工智能应用的两大挑战。本文应对这些挑战,提出一种隐私保护机器学习模型,称为联邦森林(Federated Forest),它是传统随机森林方法的无损学习模型,即达到与非隐私保护方法相同的精度水平。基于此,我们开发了一个安全的跨区域机器学习系统,允许学习过程在不同地区的客户端上联合训练,这些客户端拥有相同用户样本但不同属性集,在不交换原始数据的情况下处理存储于各处的数据。我们还提出了一种新颖的预测算法,可大幅降低通信开销。在真实世界与UCI数据集上的实验表明,联邦森林的性能与未联邦版本一样准确。我们提出系统的效率与鲁棒性已得到验证。总体而言,我们的模型对于现实任务具有实用性、可扩展性与可延展性。
引用
@article{arxiv.1905.10053,
title = {Federated Forest},
author = {Yang Liu and Yingting Liu and Zhijie Liu and Junbo Zhang and Chuishi Meng and Yu Zheng},
journal= {arXiv preprint arXiv:1905.10053},
year = {2020}
}