MoPe:基于模型扰动的语料模型隐私攻击
机器学习
2023-10-24 v1 人工智能
摘要
近期工作表明,大语言模型(LLMs)可能无意中泄露其训练数据中的敏感信息。在本文中,我们提出模型扰动(MoPe),一种在给定预训练语言模型的白盒参数访问权限下,以高置信度识别给定文本是否存在于该模型训练数据中的新方法。MoPe 在参数空间中对模型添加噪声,并测量给定点 处对数似然的下降,我们证明该统计量近似于关于模型参数的 Hessian 矩阵的迹。在参数量从 M 到 B 的语料模型上,我们表明 MoPe 比现有的基于损失的攻击和近期提出的基于扰动的方法更有效。我们还考察了训练点顺序和模型大小在攻击成功中的作用,并从经验上证明 MoPe 在实践中能准确近似 Hessian 矩阵的迹。我们的结果表明,单凭一个点的损失不足以确定可提取性——使用我们的方法可以恢复一些具有平均损失的训练点。这对先前将点的损失作为记忆化或遗忘证据的工作提出了一些质疑。
引用
@article{arxiv.2310.14369,
title = {MoPe: Model Perturbation-based Privacy Attacks on Language Models},
author = {Marvin Li and Jason Wang and Jeffrey Wang and Seth Neel},
journal= {arXiv preprint arXiv:2310.14369},
year = {2023}
}