基于零样本提示的局部差分隐私文档生成
计算与语言
2023-12-01 v2 密码学与安全
机器学习
摘要
大量研究强调了预训练大语言模型相关的隐私风险。相反,我们的研究提供了一个独特视角,证明预训练大语言模型可有效助力隐私保护。我们提出一种称为DP-Prompt的局部差分隐私机制,其利用预训练大语言模型和零样本提示的力量来抵御作者去匿名化攻击,同时将对下游效用的影晌降至最低。当DP-Prompt与如ChatGPT(gpt-3.5)等强大语言模型一同使用时,我们观察到去匿名化攻击成功率显著下降,表明尽管设计更简单,它仍以可观幅度超越现有方法。例如,在IMDB数据集上,DP-Prompt(配合ChatGPT)完美恢复干净的 sentiment F1分数,同时针对静态攻击者实现作者识别F1分数降低46%,针对自适应攻击者降低26%。我们在多达70亿参数的六个开源大语言模型上开展大量实验,以分析隐私-效用权衡的各种效应。
引用
@article{arxiv.2310.16111,
title = {Locally Differentially Private Document Generation Using Zero Shot Prompting},
author = {Saiteja Utpala and Sara Hooker and Pin Yu Chen},
journal= {arXiv preprint arXiv:2310.16111},
year = {2023}
}
备注
Accepted at EMNLP 2023 (Findings)