TIPRDC:一种面向深度学习的、基于匿名化中间表示的任务无关隐私保护数据众包框架
机器学习
2020-09-01 v7 密码学与安全
机器学习
摘要
深度学习的成功部分得益于各种大规模数据集的可用性。这些数据集通常从个人用户众包而来,并包含诸如性别、年龄等隐私信息。用户对数据共享日益增长的隐私担忧阻碍了众包数据集的生成或使用,并导致新的深度学习应用面临训练数据匮乏。一种朴素的解决方案是在用户端对原始数据进行预处理以提取特征,然后仅将提取的特征发送给数据收集者。然而,攻击者仍然可以利用这些提取的特征来训练一个对抗性分类器,以推断隐私属性。一些先前的研究利用博弈论来保护隐私属性。然而,这些防御措施是为已知的主要学习任务设计的,提取的特征对于未知的学习任务效果不佳。为了解决学习任务可能未知或变化的情况,我们提出了TIPRDC,一个任务无关的、具有匿名化中间表示的隐私保护数据众包框架。该框架的目标是学习一个特征提取器,该提取器能够从中间表示中隐藏隐私信息,同时最大限度地保留嵌入在原始数据中的原始信息,以便数据收集者完成未知的学习任务。我们设计了一种混合训练方法来学习匿名化中间表示:(1)一个对抗性训练过程,用于从特征中隐藏隐私信息;(2)使用基于神经网络的互信息估计器,最大限度地保留原始信息。
引用
@article{arxiv.2005.11480,
title = {TIPRDC: Task-Independent Privacy-Respecting Data Crowdsourcing Framework for Deep Learning with Anonymized Intermediate Representations},
author = {Ang Li and Yixiao Duan and Huanrui Yang and Yiran Chen and Jianlei Yang},
journal= {arXiv preprint arXiv:2005.11480},
year = {2020}
}