SafeSynthDP:利用大语言模型进行隐私保护合成数据生成中的差分隐私
机器学习
2024-12-31 v1 密码学与安全
摘要
机器学习(ML)模型通常依赖可能包含敏感或个人信息的训练数据,引发重大的隐私问题。像《通用数据保护条例》(GDPR)和《加州消费者隐私法案》(CCPA)这样的立法框架,促使开发能够在保持数据实用性的同时保护隐私的策略。本文我们探讨了大语言模型(LLM)生成集成差分隐私(DP)机制的合成数据集的能力,从而 enables 数据驱动的研究和模型训练,而无需直接暴露敏感信息。我们的方法将 DP 基于噪声注入方法,包括拉普拉斯和高斯分布,整合到数据生成过程中。我们通过将在其上训练的 ML 模型性能与在原始数据上训练的模型进行比较,来评估这些 DP 增强型合成数据集的实用性。为了 substantiate 隐私保证,我们评估了生成的合成数据对成员推断攻击和相关威胁的抗性。实验结果表明,在 LLM 驱动的合成数据生成中集成 DP 在隐私保护和数据实用性之间提供了一种可行的平衡。本研究为 LLM 隐私保护能力提供了基础方法和见解,为合规且有效的 ML 研究和应用铺平了道路。
引用
@article{arxiv.2412.20641,
title = {SafeSynthDP: Leveraging Large Language Models for Privacy-Preserving Synthetic Data Generation Using Differential Privacy},
author = {Md Mahadi Hasan Nahid and Sadid Bin Hasan},
journal= {arXiv preprint arXiv:2412.20641},
year = {2024}
}
备注
15 pages, 1 figure, 5 tables