中文

基于本地差分隐私的稀疏众包数据真值推断

密码学与安全 2018-08-27 v1 数据库

摘要

众包已成为一种解决计算机困难而人类容易的任务的新范式。然而,由于从招募的参与者(工人)处收集的答案可能包含敏感信息,众包引发了严重的隐私担忧。本文研究在本地差分隐私(LDP)下保护答案隐私的问题,其中各工人独立地随机化其答案并将扰动后的答案发送给任务请求者。效用目标是能够从扰动数据中以高精度推断出真实答案(即真值)。LDP扰动面临的挑战之一是工人答案的稀疏性(即每个工人仅回答少量任务)。简单扩展现有方法(如拉普拉斯扰动与随机响应)可能会在稀疏数据上产生较大的真值推断误差。因此我们设计了一种高效的LDP下新矩阵分解(MF)算法。我们证明,无论工人答案的稀疏程度如何,我们的MF算法都能同时提供LDP保证和较小的真值推断误差。我们在真实与合成数据集上进行了大量实验,表明该MF算法在稀疏众包数据上的表现优于现有LDP算法。

关键词

引用

@article{arxiv.1808.08181,
  title  = {Truth Inference on Sparse Crowdsourcing Data with Local Differential Privacy},
  author = {Haipei Sun and Boxiang Dong and Hui and Wang and Ting Yu and Zhan Qin},
  journal= {arXiv preprint arXiv:1808.08181},
  year   = {2018}
}