隐私预算调度
密码学与安全
2021-06-30 v1 分布式、并行与集群计算
机器学习
摘要
已在个人数据上训练的机器学习(ML)模型被证明会泄露关于用户的信息。差分隐私(DP)使得模型训练能够保证此泄露的边界。每一个使用DP训练的新模型都增加了数据泄露的边界,可视为消耗了不应超出的全局隐私预算的一部分。该预算是一种稀缺资源,必须仔细管理以最大化成功训练的模型数量。我们描述了PrivateKube,这是对流行Kubernetes数据中心编排器的扩展,它将隐私作为一种新型资源与传统计算资源(如CPU、GPU和内存)一同管理。我们为隐私资源设计的抽象镜像了Kubernetes为传统资源定义的那些抽象,但也存在重大差异。例如,传统计算资源是可补充的,而隐私不是:模型执行完毕后CPU可被收回,而隐私预算不能。这一区别迫使对调度器重新设计。我们提出DPF(主导私有块公平,Dominant Private Block Fairness)——一种流行的主导资源公平(DRF)算法的变体——它面向不可补充的隐私资源,但享有与DRF类似的理论性质。我们在微基准测试以及Amazon Reviews数据上的ML工作负载上评估了PrivateKube和DPF。与现有基线相比,DPF在相同全局隐私保证下允许训练更多模型。对于基于Rényi DP(一种高度可组合的DP形式)的DPF而言尤其如此。
引用
@article{arxiv.2106.15335,
title = {Privacy Budget Scheduling},
author = {Tao Luo and Mingen Pan and Pierre Tholoniat and Asaf Cidon and Roxana Geambasu and Mathias Lécuyer},
journal= {arXiv preprint arXiv:2106.15335},
year = {2021}
}
备注
Extended version of a paper presented at the 15th USENIX Symposium on Operating Systems Design and Implementation (OSDI '21)