中文

KIPPS:注入知识的隐私保护合成数据生成

机器学习 2024-09-27 v1 人工智能 密码学与安全

摘要

隐私措施的集成,包括差分隐私技术,确保了合成数据的可证明隐私保障。然而,在针对网络安全和医疗保健等关键领域的生成式深度学习模型在生成逼真数据方面面临挑战。针对连续数据的生成模型在建模离散和非高斯特征时存在困难,这些特征具有域约束。当训练数据集有限且不具代表性时,挑战进一步加剧。在这种情况下,生成模型会创建重复敏感特征的合成数据,这构成隐私风险。此外,生成模型在理解特定领域的属性约束方面也存在困难。这导致生成的不真实数据影响下游准确率。为此,本文提出一种新型模型KIPPS,将领域和监管知识从知识图谱注入生成式深度学习模型,以实现更高效的隐私保护合成数据生成。该新型框架通过补充关于属性值的上下文来增强生成模型的训练,并在训练期间强制执行域约束。这种额外的指导提高了模型生成逼真且符合域约束的合成数据的能力。该模型在真实数据集上进行了评估,具体是在医疗保健和网络安全等数据约束复杂的领域。我们的实验评估了该模型在抵御基准方法的隐私韧性和下游准确率,证明了其在复杂领域中有效平衡隐私保护与数据准确性的能力。

关键词

引用

@article{arxiv.2409.17315,
  title  = {KIPPS: Knowledge infusion in Privacy Preserving Synthetic Data Generation},
  author = {Anantaa Kotal and Anupam Joshi},
  journal= {arXiv preprint arXiv:2409.17315},
  year   = {2024}
}