分割学习中的隐私泄露评估
机器学习
2024-01-23 v3 人工智能
密码学与安全
摘要
隐私保护机器学习(PPML)可帮助我们训练并部署利用私有信息的模型。特别地,端侧机器学习使我们在推理时避免与第三方服务器共享原始数据。端侧模型通常不如服务器端对应模型准确,原因在于(1)它们通常仅依赖一小部分端侧特征,(2)它们需足够小以在终端用户设备上高效运行。分割学习(SL)是一种可克服这些限制的有前景方法。在 SL 中,大型机器学习模型被分为两部分,较大部分驻留服务器端,较小部分在端侧执行,旨在融入私有特征。然而,此类模型的端到端训练需要在切分层交换梯度,这可能编码私有特征或标签。本文中,我们深入剖析 SL 相关的潜在隐私风险。此外,我们还研究了多种缓解策略的有效性。结果表明,梯度显著提升了攻击者在所有测试数据集上的有效性,对某些特征可达近乎完美的重建精度。然而,少量差分隐私(DP)即可在不造成明显训练退化的情况下有效缓解该风险。
引用
@article{arxiv.2305.12997,
title = {Evaluating Privacy Leakage in Split Learning},
author = {Xinchi Qiu and Ilias Leontiadis and Luca Melis and Alex Sablayrolles and Pierre Stock},
journal= {arXiv preprint arXiv:2305.12997},
year = {2024}
}
备注
10 pages