中文

协作学习中的联合或独立:隐私的代价

计算机科学与博弈论 2018-08-27 v3 密码学与安全

摘要

机器学习算法已达到主流地位,并广泛部署于许多应用中。此类算法的准确性在很大程度上取决于底层训练数据集的大小;现实中,中小型组织通常没有必要的数据来训练合理准确的模型。对于此类组织,一个现实的解决方案是基于其联合数据集(即各个数据集的并集)来训练其机器学习模型。不幸的是,隐私问题阻止它们直接这样做。虽然存在许多保护隐私的解决方案,使协作组织能够在训练模型过程中安全地聚合参数,但我们不知道有任何工作为参与者提供一个理性框架,以精确平衡其协作中的隐私损失与准确性增益。在本文中,通过聚焦于双人设置,我们将协作训练过程建模为一个双人博弈,其中每个参与者旨在实现更高准确性的同时保护其自身数据集的隐私。我们引入隐私代价(Price of Privacy)的概念,这是一种用于衡量在所提框架中隐私保护对准确性影响的新方法。此外,我们为不同参与者类型开发了博弈论模型,然后针对每个参与者的隐私保护强度找到或证明纳什均衡(Nash Equilibrium)的存在性。使用推荐系统作为主要用例,我们展示了两个参与者如何实际利用所提出的理论框架,包括设置参数和近似非平凡的纳什均衡。

关键词

引用

@article{arxiv.1712.00270,
  title  = {Together or Alone: The Price of Privacy in Collaborative Learning},
  author = {Balazs Pejo and Qiang Tang and Gergely Biczok},
  journal= {arXiv preprint arXiv:1712.00270},
  year   = {2018}
}