中文

Janus 接口:大语言模型微调如何放大隐私风险

密码学与安全 2024-08-01 v3 人工智能 计算与语言 机器学习

摘要

大语言模型(LLM)的快速发展引发了公众对其庞大训练数据集中个人可识别信息(PII)泄露的担忧。近期研究表明,攻击者可通过精心设计的提示从 LLM 的训练数据中提取高度敏感的隐私数据。然而,这些攻击受限于模型在预训练阶段的幻觉倾向与灾难性遗忘(CF),导致所泄露 PII 的可信度极低。在我们的研究中,提出一种名为 Janus 的新型攻击,利用微调接口从 LLM 的预训练数据中恢复被遗忘的 PII。我们形式化了 LLM 中的隐私泄露问题,并通过在开源语言模型上的实证分析解释为何被遗忘的 PII 可被恢复。基于这些发现,我们在开源语言模型及两个最新 LLM(即 GPT-3.5-Turbo 和 LLaMA-2-7b)上评估了 Janus 的性能。实验结果显示,与基线相比,Janus 将隐私风险放大了 10 倍以上,并显著优于包括前缀攻击和上下文学习(ICL)在内的最先进隐私提取攻击。此外,我们的分析证实 OpenAI 与 Azure AI Studio 提供的现有微调 API 易受 Janus 攻击,使攻击者能以低成本实施此类攻击。

关键词

引用

@article{arxiv.2310.15469,
  title  = {The Janus Interface: How Fine-Tuning in Large Language Models Amplifies the Privacy Risks},
  author = {Xiaoyi Chen and Siyuan Tang and Rui Zhu and Shijun Yan and Lei Jin and Zihao Wang and Liya Su and Zhikun Zhang and XiaoFeng Wang and Haixu Tang},
  journal= {arXiv preprint arXiv:2310.15469},
  year   = {2024}
}

备注

This work has been accepted by CCS 2024