中文

使用 OpenAI API 微调 GPT-3 是否会泄露个人身份信息?

机器学习 2024-04-17 v3 计算与语言

摘要

机器学习从业者经常对 GPT-3 等生成式预训练模型进行微调,以提升模型在特定任务上的表现。然而,已有研究表明,微调后的机器学习模型会记忆并泄露原始微调数据集中的敏感信息。OpenAI 等公司提供其模型的微调服务,但此前尚无工作对任何闭源模型实施记忆攻击。在本文中,我们利用 OpenAI 的微调 API 对 GPT-3 模拟了一种隐私攻击。我们的目标是确定能否从该模型中提取个人身份信息(PII)。我们(1)在一个微调后的 GPT-3 分类模型上探索了朴素提示方法的使用,(2)设计了一个称为 Autocomplete 的实用词生成任务,以在真实场景下调查微调 GPT-3 中 PII 记忆的程度。我们的发现表明,为这两项任务微调 GPT-3 均导致模型记忆并泄露了来自底层微调数据集的关键个人身份信息(PII)。为鼓励进一步研究,我们已在 GitHub 上公开了代码和数据集:https://github.com/albertsun1/gpt3-pii-attacks

关键词

引用

@article{arxiv.2307.16382,
  title  = {Does fine-tuning GPT-3 with the OpenAI API leak personally-identifiable information?},
  author = {Albert Yu Sun and Eliott Zemour and Arushi Saxena and Udith Vaidyanathan and Eric Lin and Christian Lau and Vaikkunth Mugunthan},
  journal= {arXiv preprint arXiv:2307.16382},
  year   = {2024}
}