通过提示微调控制从大语言模型中提取记忆数据
计算与语言
2023-05-22 v1 人工智能
摘要
已知大语言模型(LLMs)会记忆其训练数据的显著部分。已证明这些被记忆内容的部分可通过简单查询模型而被提取出来,这带来了隐私风险。我们提出了一种利用提示微调(prompt-tuning)来控制 LLMs 中记忆内容提取率的新方法。我们提出了两种提示训练策略来分别提高和降低提取率,对应于攻击和防御。我们使用来自 GPT-Neo 系列的模型在公开基准上证明了我们技术的有效性。对于 13 亿参数的 GPT-Neo 模型,我们的攻击相比基线使提取率提高了 9.3 个百分点。我们的防御可通过用户指定的超参数调节,以实现不同的隐私-效用权衡。相比基线,我们实现了最高达 97.7% 的提取率相对降低,且困惑度增加了 16.9%。
引用
@article{arxiv.2305.11759,
title = {Controlling the Extraction of Memorized Data from Large Language Models via Prompt-Tuning},
author = {Mustafa Safa Ozdayi and Charith Peris and Jack FitzGerald and Christophe Dupuy and Jimit Majmudar and Haidar Khan and Rahil Parikh and Rahul Gupta},
journal= {arXiv preprint arXiv:2305.11759},
year = {2023}
}
备注
5 pages, 3 Figures, ACL 2023