使用联邦 XGBoost 的异常检测中隐私与精度的权衡
机器学习
2019-10-15 v2 密码学与安全
机器学习
摘要
隐私近来引发了相当大的关注,尤其是随着信息爆炸以及众多用于挖掘海量数据内部信息的数据挖掘技术的出现。在此背景下,一种称为联邦学习的新分布式学习范式近来脱颖而出,以应对分布式学习中的隐私问题,其中仅有学习模型会从分布式节点传输至服务器,而不泄露用户自身数据,从而保护用户隐私。在本文中,我们提出一种横向联邦 XGBoost 算法来解决联邦异常检测问题,其中异常检测旨在从极度不平衡的数据集中识别异常,可视为一种特殊的分类问题。我们提出的联邦 XGBoost 算法结合了数据聚合与稀疏联邦更新过程,以平衡隐私与学习性能之间的权衡。特别地,我们通过在单一分布式节点上聚合一组用户的数据来引入虚拟数据样本。我们在本地节点基于这些虚拟数据样本计算参数,并在中心服务器聚合学习模型。在学习模型升级过程中,我们更关注虚拟样本中此前被错误分类的数据,从而生成稀疏的学习模型参数。通过仔细控制这些样本组的规模,我们可以实现隐私与学习性能之间的权衡。我们的实验结果与现有最先进方法对比,显示了所提方案的有效性。
引用
@article{arxiv.1907.07157,
title = {The Tradeoff Between Privacy and Accuracy in Anomaly Detection Using Federated XGBoost},
author = {Mengwei Yang and Linqi Song and Jie Xu and Congduan Li and Guozhen Tan},
journal= {arXiv preprint arXiv:1907.07157},
year = {2019}
}