中文

我选择不透露:在可选个人数据模型中保护用户同意

机器学习 2024-02-05 v5 人工智能 计算机与社会 机器学习

摘要

我们研究了一种机器学习模型的设置,其中个体可以选择是否与决策系统共享可选个人信息,正如现代保险定价模型中所见。一些用户同意使用其数据,而另一些用户反对并使其数据不被披露。在这项工作中,我们表明,不共享数据的决定本身可被视为一种信息,为保护用户隐私应予以保护。这一观察提出了一个被忽视的问题,即如何确保保护其个人数据的用户不会因此遭受任何不利。为解决此问题,我们形式化了仅使用已获得用户主动同意的信息的模型的保护要求。这排除了包含在共享或不共享数据决定中的隐含信息。我们提出保护用户同意(Protected User Consent, PUC)的概念,作为该问题的首个解决方案,并证明其在我们的保护要求下是损失最优的。我们观察到隐私与性能之间并非根本对立,决策者在尊重用户同意的同时可以从额外数据中获益。为学习符合PUC的模型,我们设计了一种模型无关的数据增强策略,具有有限样本收敛保证。最后,我们分析了PUC在具有挑战性的真实数据集、任务和模型上的影响。

关键词

引用

@article{arxiv.2210.13954,
  title  = {I Prefer not to Say: Protecting User Consent in Models with Optional Personal Data},
  author = {Tobias Leemann and Martin Pawelczyk and Christian Thomas Eberle and Gjergji Kasneci},
  journal= {arXiv preprint arXiv:2210.13954},
  year   = {2024}
}

备注

v5: AAAI-24 Camera-Ready Version Including Appendices. v1: NeurIPS 2022 Workshop on Algorithmic Fairness through the Lens of Causality and Privacy (AFCP)