使用大语言模型的差分隐私表格数据合成
机器学习
2024-06-05 v1 计算与语言
密码学与安全
摘要
具有差分隐私的合成表格数据生成是一个关键问题,能够实现具有形式化隐私的数据共享。尽管方法论研究和开发有着丰富的历史,但开发能够提供真实合成数据集的差分隐私表格数据生成器仍然具有挑战性。本文介绍了DP-LLMTGen——一种新颖的差分隐私表格数据合成框架,利用预训练的大语言模型。DP-LLMTGen使用一种专门为表格数据设计的新型损失函数,通过两阶段微调过程对敏感数据集进行建模。随后,它通过对微调后的大语言模型进行采样来生成合成数据。我们的实证评估表明,DP-LLMTGen在多个数据集和隐私设置下优于各种现有机制。此外,我们进行了消融研究和多项实验分析,以加深对大语言模型在解决这一重要问题中的理解。最后,我们通过公平性约束生成设置突出了DP-LLMTGen的可控生成能力。
引用
@article{arxiv.2406.01457,
title = {Differentially Private Tabular Data Synthesis using Large Language Models},
author = {Toan V. Tran and Li Xiong},
journal= {arXiv preprint arXiv:2406.01457},
year = {2024}
}