中文

通过基础模型API的差分隐私合成数据2:文本

计算与语言 2024-07-25 v2

摘要

随着机器学习算法的出现,文本数据变得极具价值。现实世界中产生的大量高质量文本数据是私有的,因此由于隐私问题无法自由共享或使用。生成具有正式隐私保证(即差分隐私,DP)的私有文本数据的合成副本,提供了一种有前景且可扩展的解决方案。然而,现有方法需要在私有数据上对大型语言模型(LLM)进行DP微调,以生成DP合成数据。这种方法对于专有LLM(如GPT-3.5)不可行,并且对于开源LLM也需要大量计算资源。Lin等人(2024)最近引入了私有进化(PE)算法,仅通过扩散模型的API访问即可生成DP合成图像。在本工作中,我们提出了一种增强的PE算法,名为Aug-PE,适用于文本的复杂场景。我们通过API访问LLM,无需任何模型训练即可生成DP合成文本。我们在三个基准数据集上进行了全面实验。结果表明,Aug-PE生成的DP合成文本在效用上与最先进的DP微调基线具有竞争力。这强调了仅依靠LLM的API访问即可生成高质量DP合成文本的可行性,从而为隐私保护的LLM应用提供了更易实现的途径。我们的代码和数据可在https://github.com/AI-secure/aug-pe获取。

关键词

引用

@article{arxiv.2403.01749,
  title  = {Differentially Private Synthetic Data via Foundation Model APIs 2: Text},
  author = {Chulin Xie and Zinan Lin and Arturs Backurs and Sivakanth Gopi and Da Yu and Huseyin A Inan and Harsha Nori and Haotian Jiang and Huishuai Zhang and Yin Tat Lee and Bo Li and Sergey Yekhanin},
  journal= {arXiv preprint arXiv:2403.01749},
  year   = {2024}
}

备注

ICML'24 Spotlight