中文

解耦与采样:在任务无关数据发布中保护敏感信息

密码学与安全 2022-03-25 v1 计算机视觉与模式识别 计算机与社会 机器学习

摘要

我们提出 sanitizer,一个用于安全且任务无关数据发布的框架。尽管发布数据集在计算机视觉的各类应用中持续产生重大影响,但当数据共享不受隐私顾虑阻碍时,其影响才大多得以实现。我们通过两阶段过程对数据集进行净化以缓解这些顾虑。首先,我们引入全局解耦阶段,将原始数据分解为敏感与非敏感潜在表示。其次,我们设计局部采样阶段,以差分隐私合成生成敏感信息,并将其与非敏感潜在特征合并,从而在保护隐私的同时创建有用表示。这一新形成的潜在信息是原始数据集的任务无关表示,其中敏感信息已被匿名化。尽管大多数算法以任务依赖方式净化数据,少数任务无关净化技术通过屏蔽敏感信息来净化数据。本工作中,我们表明若能对敏感信息进行私有合成,则可实现更好的隐私-效用权衡。我们通过在现有基准任务上超越 SOTA 基线并展示现有技术无法完成的任务,验证了 sanitizer 的有效性。

关键词

引用

@article{arxiv.2203.13204,
  title  = {Decouple-and-Sample: Protecting sensitive information in task agnostic data release},
  author = {Abhishek Singh and Ethan Garza and Ayush Chopra and Praneeth Vepakomma and Vivek Sharma and Ramesh Raskar},
  journal= {arXiv preprint arXiv:2203.13204},
  year   = {2022}
}

备注

Preprint