中文

用于机器学习中压缩隐私的脱敏 RDCA 子空间

密码学与安全 2017-07-26 v1 机器学习

摘要

对更优数据分析和人工智能的追求导致越来越多的数据被收集和存储。因此,更多数据暴露于恶意实体面前。本文研究了机器学习分类中的隐私问题。我们利用岭判别分量分析(Ridge Discriminant Component Analysis, RDCA)对数据进行脱敏处理,以针对隐私标签。基于五个实验,我们表明通过 RDCA 进行脱敏可以有效保护隐私(即对隐私标签的低准确率),同时效用损失很小。在 HAR 和 CMU Faces 数据集上,使用脱敏数据导致隐私准确率达到随机猜测水平,而效用准确率平均分别下降 5.14% 和 0.04%。对于 Semeion 手写数字数据集,隐私敏感数字的准确率几乎为零,而效用相关数字的准确率平均下降 7.53%。这为机器学习分类中的隐私问题提供了一种有前景的解决方案。

关键词

引用

@article{arxiv.1707.07770,
  title  = {Desensitized RDCA Subspaces for Compressive Privacy in Machine Learning},
  author = {Artur Filipowicz and Thee Chanyaswad and S. Y. Kung},
  journal= {arXiv preprint arXiv:1707.07770},
  year   = {2017}
}