中文

隐私保护特征选择:综述及一组新协议提议

密码学与安全 2020-08-19 v1 机器学习

摘要

特征选择是筛选特征的过程,即将信息性特征与冗余及无关特征分离。该过程在机器学习、数据挖掘和生物信息学中起着重要作用。然而,传统特征选择方法仅能处理集中式数据集,无法满足当今分布式数据处理需求。这些需求要求一类称为隐私保护特征选择的新数据处理算法,其通过在中间处理与最终结果中均不泄露任何数据部分来保护用户数据。这对于包含个人数据(如医疗数据集)的数据集至关重要。因此,合理做法是修改现有算法或提出新算法,不仅引入应用于分布式数据集的能力,还在处理用户数据时通过保护隐私而负责任地行事。本文中,我们将回顾三种隐私保护特征选择方法,并在发现任何不足时提供改进建议。我们还将提出一种基于粗糙集特征选择的隐私保护特征选择方法。所提方法能够在两方与多方场景下处理水平与垂直划分的数据集。

关键词

引用

@article{arxiv.2008.07664,
  title  = {Privacy-preserving feature selection: A survey and proposing a new set of protocols},
  author = {Javad Rahimipour Anaraki and Saeed Samet},
  journal= {arXiv preprint arXiv:2008.07664},
  year   = {2020}
}

备注

29 pages, 4 figures