中文

AdKDD'21 隐私保护机器学习挑战赛的经验启示

机器学习 2022-02-01 v1 密码学与安全

摘要

设计在提供性能的同时具备强隐私保证的数据共享机制是在线广告行业的热点话题。具体而言,W3C 改善网络广告业务组讨论的一项突出提案仅允许通过对过往展示的聚合差分隐私报告来共享广告信号。为广泛研究该提案,AdKDD'21(由广告公司 Criteo 提供数据的广告科学顶级研讨会)举办了一场公开的隐私保护机器学习挑战赛。在本文中,我们描述了挑战任务、可用数据集的结构,报告了挑战结果,并使其完全可复现。一个关键发现是,在存在少量未聚合数据点的情形下,在大型聚合数据上学习模型可以出奇地高效且廉价。我们还进行了额外实验,以观察获胜方法对不同参数(如隐私预算或可获取的特权侧信息数量)的敏感性。我们得出结论:行业要么需要替代的私有数据共享设计,要么需要在仅使用聚合数据学习方面取得突破,才能将广告相关性保持在合理水平。

关键词

引用

@article{arxiv.2201.13123,
  title  = {Lessons from the AdKDD'21 Privacy-Preserving ML Challenge},
  author = {Eustache Diemert and Romain Fabre and Alexandre Gilotte and Fei Jia and Basile Leparmentier and Jérémie Mary and Zhonghua Qu and Ugo Tanielian and Hui Yang},
  journal= {arXiv preprint arXiv:2201.13123},
  year   = {2022}
}