不可信推荐引擎中的隐私代价
机器学习
2014-10-29 v2 信息论
math.IT
摘要
近期在线隐私担忧的增加引发了以下问题:如果用户不将私人数据托付给推荐系统,该系统还能保持准确吗?为回答此问题,我们研究了在本地差分隐私(一种强大的形式化数据隐私概念)下学习物品簇的问题。我们建立了从私有化用户输入中学习物品簇的样本复杂度界限。重要的是,我们的结果揭示了在信息丰富 regime 与信息稀缺 regime 之间学习过程的样本复杂度分离,从而突出了隐私与每个用户可用信息量(评分)之间的相互作用。在信息丰富 regime 中,即每个用户对至少恒定比例的物品进行评分时,谱聚类方法被证明能达到基于 Fano 不等式的简单信息论论证所导出的样本复杂度下界。然而,在信息稀缺 regime 中,即每个用户仅对趋于零比例的物品进行评分时,发现无论是下界还是算法都需要根本不同的方法。为此,我们开发了在信道失配概念下界定互信息的新技巧,并提出了一种新算法 MaxSense,证明其在该设定下实现了最优样本复杂度。我们开发的互信息界定技巧可能具有更广泛的兴趣。为说明这一点,我们展示了它们适用于 (i) 基于 1-bit 草图的学习,以及 (ii) 自适应学习,其中查询可根据过去查询的答案进行调整。
引用
@article{arxiv.1207.3269,
title = {The Price of Privacy in Untrusted Recommendation Engines},
author = {Siddhartha Banerjee and Nidhi Hegde and Laurent Massoulié},
journal= {arXiv preprint arXiv:1207.3269},
year = {2014}
}
备注
Preliminary version presented at the 50th Allerton Conference, 2012