中文

基于差分成对隐私的安全度量学习

机器学习 2020-03-31 v1 机器学习

摘要

距离度量学习(DML)在过去二十年中备受关注。大量先前研究表明,在给定领域专家正确标注的成对数据集合时,该方法在度量个体相似性方面表现良好。这些重要且精确标注的成对数据在现实世界中往往高度敏感(例如患者相似性)。本文首次研究了在距离度量学习过程中成对信息如何泄露给攻击者,并提出了差分成对隐私(DPP),推广了标准差分隐私的定义,用于安全度量学习。传统差分隐私仅适用于独立样本,因而无法用于成对数据,而DPP通过重构最坏情况成功解决了这一问题。具体而言,给定成对数据,我们揭示了所构建无向图中各对之间的所有相关关系。随后形式化定义DPP,指明何种DML算法能够保护成对数据隐私。此后,以对比损失为例进行案例研究,阐明实现DPP-DML算法的细节。特别地,提出了敏感度缩减技术以提升输出距离度量的效用。在玩具数据集和基准数据集上的实验表明,所提方案在实现成对数据隐私的同时,对输出性能影响甚微(当隐私预算设为4时,所有基准数据集上的准确率下降均小于0.01)。

关键词

引用

@article{arxiv.2003.13413,
  title  = {Secure Metric Learning via Differential Pairwise Privacy},
  author = {Jing Li and Yuangang Pan and Yulei Sui and Ivor W. Tsang},
  journal= {arXiv preprint arXiv:2003.13413},
  year   = {2020}
}