中文

基于 l-多样性的数据分类的统计学习理论方法

机器学习 2016-10-20 v1 密码学与安全 数据库

摘要

企业正在保留越来越大的个人数据语料库;数据泄露的频率及相应的隐私影响也随之上升。减轻这种风险的一种方法是使用匿名化数据,将个人数据的暴露限制在绝对需要的范围内。这对于数据挖掘似乎特别合适,因为其目标是可推广的知识而非特定个人的数据。在实践中,由于担心使用匿名化或差分隐私方法可能会“遗漏某些信息”,企业的数据挖掘者通常坚持使用原始数据。本文为使用匿名化数据提供了理论依据。具体而言,我们表明,在满足 l-多样性的匿名化数据上训练的支持向量分类器,预期应能取得与在原始数据上训练一样好的效果。Anatomy 保留了所有数据值,但在标识值与敏感值之间的映射中引入了不确定性,从而满足 l-多样性。所提方法的理论有效性通过几个公开可用的数据集得到了验证,结果表明,在使用受 k-匿名性保护的训练数据进行支持向量分类时,我们的表现优于 state of the art,并且与在原始数据上的学习效果相当。

关键词

引用

@article{arxiv.1610.05815,
  title  = {Statistical Learning Theory Approach for Data Classification with l-diversity},
  author = {Koray Mancuhan and Chris Clifton},
  journal= {arXiv preprint arXiv:1610.05815},
  year   = {2016}
}

备注

Technical Report