中文

TabLeak:联邦学习中的表格数据泄露

机器学习 2023-07-10 v2 密码学与安全 分布式、并行与集群计算

摘要

尽管联邦学习(FL)承诺保护隐私,近期在图像与文本领域的工作已表明训练更新会泄露私有客户端数据。然而,FL 大多数高风险应用(如医疗与金融)使用表格数据,而其中数据泄露风险尚未被探究。针对表格数据的成功攻击须应对该领域独有的两个关键挑战:(i)求解高方差混合离散-连续优化问题,(ii)使人类能评估重构结果,因为不同于图像与文本数据,无法直接人工检视。本工作中我们应对这些挑战并提出 TabLeak,首个针对表格数据的全面重构攻击。TabLeak 基于两项关键贡献:(i)一种利用 softmax 松弛与池化集成求解优化问题的方法,(ii)一种基于熵的不确定性量化方案以支持人工评估。我们在四个表格数据集上针对 FedSGD 与 FedAvg 训练协议评估 TabLeak,表明其成功攻破了若干先前认为安全的设定。例如,即便在 128 的大批量大小下,我们也能以 >90% 准确率提取大比例私有数据。我们的发现表明,当前高风险表格 FL 对泄露攻击极度脆弱。

关键词

引用

@article{arxiv.2210.01785,
  title  = {TabLeak: Tabular Data Leakage in Federated Learning},
  author = {Mark Vero and Mislav Balunović and Dimitar I. Dimitrov and Martin Vechev},
  journal= {arXiv preprint arXiv:2210.01785},
  year   = {2023}
}