匿名化数据中模式保留的度量——单一度量不足以胜任
人工智能
2015-12-25 v1
摘要
在本文中,我们探究为保护隐私而修改数据如何影响该数据中可发现模式的质量。要使任何对修改后数据的分析值得进行,数据必须尽可能接近原始数据。这其中存在一个问题——如何确保修改后的数据仍包含修改前所具有的信息?该问题不同于询问能否从修改后的数据构建准确的分类器。文献中常将基于修改(匿名化)数据所建分类器的预测准确率用作数据类似于原始数据的证据。我们证明事实并非如此,并提出了一种度量原始数据中存在的模式保留程度的新方法论。随后我们利用该方法论设计了三种易于实现的度量,每种度量均衡量现有任何技术都无法测度的数据方面。这些度量并不否定预测准确率或其他度量的有用性——它们与之互补,并支持我们的论点:一种度量几乎永远不够。
引用
@article{arxiv.1512.07721,
title = {Measuring pattern retention in anonymized data -- where one measure is not enough},
author = {Sam Fletcher and Md Zahidul Islam},
journal= {arXiv preprint arXiv:1512.07721},
year = {2015}
}