表格合成数据中基于对比学习的隐私度量
机器学习
2025-03-11 v2 密码学与安全
摘要
在医疗和金融等领域,合成数据作为一种隐私增强技术(PET)备受关注。在实际应用中使用合成数据时,提供保护保证至关重要。文献中针对表格数据提出了两类方法:一方面,基于相似性的方法旨在寻找训练数据与合成数据之间的相似度水平。事实上,如果生成的数据始终与训练数据过于相似甚至完全相同,就会发生隐私泄露。另一方面,基于攻击的方法对合成数据集实施蓄意攻击。这些攻击的成功率揭示了合成数据集的安全性。在本文中,我们引入了一种对比方法,通过将数据嵌入到更具代表性的空间来改进合成数据集的隐私评估。这克服了围绕众多数据类型和属性的障碍。它还使得在相似性度量和作为攻击向量时使用直观的距离度量成为可能。在使用公开数据集的一系列实验中,我们比较了基于相似性和基于攻击的方法在使用和不使用基于对比学习的嵌入时的性能。结果表明,相对高效且易于实现的隐私度量,其表现可以与显式建模 GDPR 所述隐私条件的更高级度量同样出色。
引用
@article{arxiv.2502.13833,
title = {Contrastive Learning-Based privacy metrics in Tabular Synthetic Datasets},
author = {Milton Nicolás Plasencia Palacios and Sebastiano Saccani and Gabriele Sgroi and Alexander Boudewijn and Luca Bortolussi},
journal= {arXiv preprint arXiv:2502.13833},
year = {2025}
}