中文

DP-2Stage:将语言模型适配为差分隐私表格数据生成器

机器学习 2025-04-30 v2 计算与语言 密码学与安全

摘要

在差分隐私(DP)保护下生成表格数据能够确保理论隐私保证,但会给训练机器学习模型带来挑战,主要是需要在噪声监督信号下捕获复杂结构。最近,尽管规模仅为 GPT-2 级别的大型语言模型(LLM),在合成表格数据方面仍显示出巨大的潜力。然而,在DP约束下的其应用仍基本未被探索。本文通过将DP技术应用于合成表格数据的生成来弥补这一空白。我们的发现表明,在DP条件下微调语言模型时,因隐私预算在非私有元素(如表结构)上效率低下,导致其在生成连贯文本方面面临困难。为克服这一问题,我们提出了DP-2Stage,这是一个用于差分隐私表格数据生成的两阶段微调框架。第一阶段是在伪数据集上进行非私有微调,随后在私有数据集上进行DP微调。我们的实证结果表明,与在DP上下文中直接微调的语言模型相比,该方法在各种设置和指标下均表现出更好的性能。我们在 https://github.com/tejuafonja/DP-2Stage 上发布了代码和设置。

关键词

引用

@article{arxiv.2412.02467,
  title  = {DP-2Stage: Adapting Language Models as Differentially Private Tabular Data Generators},
  author = {Tejumade Afonja and Hui-Po Wang and Raouf Kerkouche and Mario Fritz},
  journal= {arXiv preprint arXiv:2412.02467},
  year   = {2025}
}