PRIVET:基于极值理论的隐私度量
机器学习
2025-10-29 v1
摘要
深度生成模型通常在敏感数据上进行训练,如基因序列、健康数据或更广泛的受版权、受许可或受保护内容。这是引发隐私保护合成数据问题的关键关注点,特别是隐私泄露,与过拟合密切相关。现有方法几乎全部依赖全局准则来估计模型与隐私失败风险关联的风险,仅提供定性非可解释见解。缺乏对数据隐私在样本级别进行严格评估的方法可能阻碍合成数据在实际应用中的部署。我们利用最近邻距离中的极值统计学,提出一种通用的基于样本的、模态无关的算法PRIVET,为每个合成样本分配一个 individual 隐私泄露评分。我们经验性地证明PRIVET可靠地检测了跨多种数据模态的记忆和隐私泄露实例,包括极高维度、有限样本大小(如基因数据)以及 underfitting 场景。我们在受控环境下将方法与现有方法进行比较,展示了其在通过定性和定量输出中提供 dataset 级别和 sample 级别评估方面的优势。此外,我们的分析揭示了现有计算机视觉嵌入在识别 near-duplicate 样本时缺乏感知上有意义的距离。
引用
@article{arxiv.2510.24233,
title = {PRIVET: Privacy Metric Based on Extreme Value Theory},
author = {Antoine Szatkownik and Aurélien Decelle and Beatriz Seoane and Nicolas Bereux and Léo Planche and Guillaume Charpiat and Burak Yelmen and Flora Jay and Cyril Furtlehner},
journal= {arXiv preprint arXiv:2510.24233},
year = {2025}
}