中文

Wildest Dreams:隐私保护神经网络训练中的可复现研究

密码学与安全 2024-03-07 v1 人工智能

摘要

机器学习 (ML) 解决了包括社会科学、金融和医学研究在内的多个学科中的众多复杂问题。ML 模型需要大量的计算能力,且其能力仅限于所用数据的水平。由于 ML 方法的高计算成本,数据科学家经常使用机器学习即服务 (MLaaS) 将计算外包给外部服务器。然而,当处理财务数据或健康记录等私人信息时,外包计算可能会导致隐私问题。隐私保护技术 (PPTs) 的最新进展使得利用隐私保护机器学习 (PPML) 在受保护数据上进行 ML 训练和推理成为可能。然而,这些技术仍处于初步阶段,其在现实世界中的应用具有挑战性。为了理解理论研究建议与实际应用之间的差异,这项工作考察了 PPML 的过去和现在,重点关注应用于 ML 的同态加密 (HE) 和安全多方计算 (SMPC)。这项工作主要关注 ML 模型的训练阶段,其中维护用户数据隐私至关重要。我们提供了坚实的理论背景,以简化对当前方法及其局限性的理解。此外,我们提供了最新 PPML 模型训练框架的系统性知识总结 (SoK),并在独特属性和标准基准性能方面提供了全面比较。同时,我们复现了一些论文的结果,并考察了该领域的现有工作在何种程度上支持开放科学。我们相信,我们的工作通过提高人们对 PPML 中理论进步与实际应用之间当前差距的认识,特别是在开源可用性、可复现性和可用性方面,做出了有价值的贡献。

关键词

引用

@article{arxiv.2403.03592,
  title  = {Wildest Dreams: Reproducible Research in Privacy-preserving Neural Network Training},
  author = {Tanveer Khan and Mindaugas Budzys and Khoa Nguyen and Antonis Michalas},
  journal= {arXiv preprint arXiv:2403.03592},
  year   = {2024}
}