中文

MoPe:基于模型扰动的语料模型隐私攻击

机器学习 2023-10-24 v1 人工智能

摘要

近期工作表明,大语言模型(LLMs)可能无意中泄露其训练数据中的敏感信息。在本文中,我们提出模型扰动(MoPe),一种在给定预训练语言模型的白盒参数访问权限下,以高置信度识别给定文本是否存在于该模型训练数据中的新方法。MoPe 在参数空间中对模型添加噪声,并测量给定点 xx 处对数似然的下降,我们证明该统计量近似于关于模型参数的 Hessian 矩阵的迹。在参数量从 7070M 到 1212B 的语料模型上,我们表明 MoPe 比现有的基于损失的攻击和近期提出的基于扰动的方法更有效。我们还考察了训练点顺序和模型大小在攻击成功中的作用,并从经验上证明 MoPe 在实践中能准确近似 Hessian 矩阵的迹。我们的结果表明,单凭一个点的损失不足以确定可提取性——使用我们的方法可以恢复一些具有平均损失的训练点。这对先前将点的损失作为记忆化或遗忘证据的工作提出了一些质疑。

关键词

引用

@article{arxiv.2310.14369,
  title  = {MoPe: Model Perturbation-based Privacy Attacks on Language Models},
  author = {Marvin Li and Jason Wang and Jeffrey Wang and Seth Neel},
  journal= {arXiv preprint arXiv:2310.14369},
  year   = {2023}
}