中文

保秩数据集混淆中的隐私-效用权衡

信息论 2023-05-15 v1 密码学与安全 数据库 math.IT

摘要

数据集混淆指的是在给定数据集公开发布之前,向其条目添加随机噪声以保护私人信息泄露的技术。本工作考虑在两个目标下的数据集混淆:i) 保秩:保留由给定秩函数所诱导的混淆后数据集中的行顺序;ii) 匿名性:在指纹攻击下保护用户匿名性。第一个目标,即保秩,在搜索引擎与推荐系统、特征匹配以及社交网络分析等应用中备受关注。在评估匿名性目标时所考虑的指纹攻击,是一种隐私攻击,其中攻击者基于受害者的观测活动(例如在线网络活动)构建其指纹,并将该指纹与从公开发布的混淆数据集中提取的信息进行比较以识别受害者。通过评估一类混淆机制在渐近大数据集上的性能极限,我们量化了保秩与用户匿名性之间的基本权衡。我们考虑了单字母混淆机制,其中数据集中的每个条目都被独立噪声扰动,并利用大偏差技术刻画了它们的基本性能极限。优化隐私-效用权衡的最优混淆测试信道被刻画为一个可高效求解的凸优化问题形式。我们提供了多种场景的数值模拟以验证理论推导。

关键词

引用

@article{arxiv.2305.07079,
  title  = {The Privacy-Utility Tradeoff in Rank-Preserving Dataset Obfuscation},
  author = {Mahshad Shariatnasab and Farhad Shirani and S. Sitharma Iyengar},
  journal= {arXiv preprint arXiv:2305.07079},
  year   = {2023}
}