基于Ehrhart理论的隐私与保真度权衡
信息论
2022-03-02 v1 math.IT
摘要
随着现今越来越多的数据被收集并存储于数据库(DB)中,如何保护DB中个体记录的隐私,同时能对DB的查询提供准确回答,这一问题随之产生。差分隐私(DP)已作为量化算法隐私泄露脆弱性的框架获得认可。我们考虑通过一个DP机制对整个DB进行净化、并在其上执行无限后续查询的问题。在保护隐私的同时,净化的DB仍提供准确查询响应十分重要。本工作的核心贡献是刻画最优DP数据库净化机制(DSM)中所保留的信息量。我们精确刻画了在大型DB渐近 regime 下净化DB的机制的工具性-隐私权衡。我们在信息论框架中研究此问题,通过对数据上的通用分布以及原始与净化DB直方图间保真度的度量进行建模。我们考虑流行的失真度量,其导致表述为线性规划(LP)。该优化问题在复杂度上难以处理,其约束数量随问题参数呈指数增长。借助离散几何、解析组合学与优化对偶定理的工具,我们完全刻画了最优解,将其表示为幂级数,其系数为Ehrhart于1967年研究的多维凸多面体上的整数点个数。利用Ehrhart理论,我们确定了最优隐私-保真度权衡渐近增长的简单闭式可计算表达式,达到无限精度。这些发现的核心在于最小期望失真与整凸多面体的Ehrhart级数之间的深刻联系。
引用
@article{arxiv.1803.03611,
title = {The Trade-off between Privacy and Fidelity via Ehrhart Theory},
author = {Arun Padakandla and P. R. Kumar and Wojciech Szpankowski},
journal= {arXiv preprint arXiv:1803.03611},
year = {2022}
}
备注
Submitted to IEEE Transactions on Information Theory