中文

敏感信息能否从大语言模型中删除?抵御提取攻击的目标

计算与语言 2023-10-02 v1 人工智能 机器学习

摘要

预训练语言模型有时拥有我们不希望其具备的知识,包括已记忆的个人信息以及可能用于伤害他人的知识。它们也可能输出有毒或有害文本。为缓解这些安全与信息问题,我们提出一种攻击-防御框架,用于研究直接从模型权重中删除敏感信息的任务。我们研究对模型权重的直接编辑,因为 (1) 该方法应保证特定已删除信息在未来提示攻击中绝不会被提取,(2) 它应抵御白盒攻击,这对于在公开可用模型权重可能被用来引出敏感信息的设定下做出安全/隐私声明是必要的。我们的威胁模型假设:若对敏感问题的答案位于一组 B 个生成候选之中,则攻击成功,这基于答案出现在 B 个候选中时信息即不安全的场景。实验上,我们表明即便如 ROME 之类最先进的模型编辑方法也难以真正从 GPT-J 等模型中删除事实性信息,因为我们的白盒与黑盒攻击能以 38% 的概率从编辑后模型中恢复“已删除”信息。这些攻击利用了两个关键观察:(1) 已删除信息的痕迹可在模型中间隐藏状态中发现,(2) 对一个问题应用编辑方法未必能跨该问题的改写版本删除信息。最后,我们提供了抵御部分提取攻击的新防御方法,但未找到单一普遍有效的防御方法。我们的结果表明,真正删除敏感信息是一个可行但困难的问题,因为即便相对较低的攻击成功率,对语言模型实际部署也具有潜在严重的社会影响。

关键词

引用

@article{arxiv.2309.17410,
  title  = {Can Sensitive Information Be Deleted From LLMs? Objectives for Defending Against Extraction Attacks},
  author = {Vaidehi Patil and Peter Hase and Mohit Bansal},
  journal= {arXiv preprint arXiv:2309.17410},
  year   = {2023}
}

备注

Equal contribution from first two authors. 19 pages, 5 figures. Our code is available at: https://github.com/Vaidehi99/InfoDeletionAttacks