同步误差下与分布无关的数据库去匿名化
信息论
2023-10-26 v2 math.IT
摘要
近来,科学界对利用公开可用的相关数据通过多种匹配策略对含用户级微数据的匿名数据库中用户进行去匿名化的兴趣日益增加。现有文献要么侧重无需底层数据分布的实际方面(理论保证有限或缺失),要么在假定底层分布完全可得的前提下侧重理论方面。本文中,我们为无数据分布先验知识的随机相关数据库去匿名化提供理论保证,从而朝调和上述两类工作迈出一步。受时间索引微数据启发,我们考虑在同步误差(列重复)与混淆(噪声)同时存在的数据库去匿名化。通过修改先前使用的副本检测算法以适应未知底层分布、提出一种新的种子化删除检测算法,并运用统计与信息论工具,我们推导出了成功匹配所需的数据库增长率充分条件。我们的发现表明,相对于行尺寸的双对数种子大小可确保成功的删除检测。更重要的是,我们证明所推导的充分条件与已知分布设定下相同,即因底层分布未知而导致的渐近性能损失为零。
引用
@article{arxiv.2309.14484,
title = {Distribution-Agnostic Database De-Anonymization Under Synchronization Errors},
author = {Serhat Bakirtas and Elza Erkip},
journal= {arXiv preprint arXiv:2309.14484},
year = {2023}
}