中文

Masked LARk:掩蔽学习、聚合与上报工作流

密码学与安全 2021-10-29 v1 机器学习 机器学习

摘要

如今,许多网络广告数据流涉及对用户的被动跨站跟踪。通过第三方跟踪 cookie(3PC)使用此类机制,会将敏感用户数据暴露给大量参与方,且对数据如何被使用几乎缺乏监督。因此,大多数浏览器正逐步在后续版本中移除 3PC。为了在大幅改善终端用户隐私的同时允许站点继续通过广告资助维持业务,需要引入新的隐私保护原语。本文讨论了一项称为 Masked LARk 的新提案,用于用户参与度度量和模型训练的聚合,该方案防止跨站跟踪,同时保持(a)灵活性,便于工程开发和维护,(b)安全性,即阻止跨站跟踪与追踪,以及(c)对持续模型开发与训练的开放性,使广告主能向感兴趣的用户投放相关广告。我们引入了一种安全多方计算(MPC)协议,利用“helper”方来训练模型,使得一旦数据离开浏览器,任何下游系统都无法单独构建用户活动的完整画像。对于训练,我们的关键创新在于使用掩蔽(masking),即混淆真实标签,同时仍允许在一批数据上准确聚合计算梯度。我们的协议仅使用轻量密码学,其程度使有兴趣但缺乏经验的读者也能理解核心算法。我们开发了实现该系统的 helper 端点,并给出了 PyTorch 中的训练示例用法。

关键词

引用

@article{arxiv.2110.14794,
  title  = {Masked LARk: Masked Learning, Aggregation and Reporting worKflow},
  author = {Joseph J. Pfeiffer and Denis Charles and Davis Gilton and Young Hun Jung and Mehul Parsana and Erik Anderson},
  journal= {arXiv preprint arXiv:2110.14794},
  year   = {2021}
}

备注

Microsoft Journal of Applied Research (MSJAR Volume 16)