中文

防止语言模型逐字记忆带来虚假的隐私安全感

机器学习 2023-09-12 v3 计算与语言

摘要

研究神经语言模型中的数据记忆有助于我们理解模型复述训练数据所带来的风险(例如对隐私或版权)并有助于开发对策。许多先前的工作——以及一些近期部署的防御措施——聚焦于“逐字记忆”,定义为与训练集中某个子串完全匹配的模型生成内容。我们认为逐字记忆的定义过于受限,未能捕捉更微妙的记忆形式。具体而言,我们设计并实现了一种高效防御,可完美防止所有逐字记忆。然而,我们证明这一“完美”过滤器并不能阻止训练数据的泄露。事实上,它通过合理且经过极小修改的“风格迁移”提示——在某些情况下甚至未修改的原始提示——就能被轻易规避以提取记忆的信息。我们以讨论潜在的替代定义以及为何定义记忆是神经语言模型中一个困难却关键的开问题作结。

关键词

引用

@article{arxiv.2210.17546,
  title  = {Preventing Verbatim Memorization in Language Models Gives a False Sense of Privacy},
  author = {Daphne Ippolito and Florian Tramèr and Milad Nasr and Chiyuan Zhang and Matthew Jagielski and Katherine Lee and Christopher A. Choquette-Choo and Nicholas Carlini},
  journal= {arXiv preprint arXiv:2210.17546},
  year   = {2023}
}