使用解剖化数据的 K 近邻分类
机器学习
2016-10-30 v1 密码学与安全
数据库
摘要
本文分析了使用解剖化方法进行匿名化处理的训练数据下的 k 近邻分类。解剖化保留了所有数据值,但在标识值与敏感值之间的映射中引入了不确定性。我们首先研究了经解剖化的训练数据对 k 近邻错误率界限、最近邻收敛速率和贝叶斯错误率的理论影响。然后,我们通过实验验证了推导出的界限。我们表明:1) 从解剖化数据中学习可以接近通过未受保护数据学习的极限(尽管需要更大的训练数据量),2) 使用解剖化数据的最近邻分类性能优于基于泛化的匿名化方法上的最近邻分类。
引用
@article{arxiv.1610.06048,
title = {K-Nearest Neighbor Classification Using Anatomized Data},
author = {Koray Mancuhan and Chris Clifton},
journal= {arXiv preprint arXiv:1610.06048},
year = {2016}
}
备注
Technical Report. arXiv admin note: text overlap with arXiv: 1610.05815