一种面向隐私的代数拓扑方法:数值与类别数据
数据库
2016-02-23 v1 密码学与安全
摘要
在本文中,我们将给定数据库实现k-匿名的经典问题转化为代数拓扑中的问题。利用该数学领域的技术,我们提出了一种k-匿名框架,为数据库匿名化带来新见解与算法。我们首先处理数据位于度量空间中的较简单情况。该情况有助于引入主要思想和符号。具体而言,通过将数据库映射到欧氏空间并考虑数据点间距离,我们引入数据的单纯形表示,并展示代数拓扑中的概念(如神经复形与持续同调)如何被应用于高效获得数据库在各种k值与泛化水平下的完整k-匿名谱。针对此表示,我们给出了数据集的给定表示是k-匿名的条件的解析表征。我们引入了加权条码图,在此背景下其成为权衡数据匿名性与以泛化水平表示的数据丢失的计算工具。一些仿真结果用于阐明论文主要思想。我们在文末讨论了如何将该方法扩展至处理类别与度量数据混合的一般情况。
引用
@article{arxiv.1602.06643,
title = {An Algebraic Topological Approach to Privacy: Numerical and Categorical Data},
author = {Alberto Speranzon and Shaunak D. Bopardikar},
journal= {arXiv preprint arXiv:1602.06643},
year = {2016}
}