中文

去重训练数据缓解语言模型中的隐私风险

密码学与安全 2022-12-21 v3 计算与语言 机器学习

摘要

已有研究表明,大型语言模型易受隐私攻击,攻击者从训练好的模型生成序列并检测哪些序列是从训练集中记忆而来的。本工作中,我们表明这些攻击的成功在很大程度上源于常用网络抓取训练集中的重复。我们首先表明,语言模型再生训练序列的速率与序列在训练集中的出现次数呈超线性关系。例如,在训练数据中出现10次的序列,平均被生成的概率约为仅出现1次的序列的1000倍。我们接着表明,现有检测记忆序列的方法在非重复训练序列上的准确率接近随机。最后,我们发现,在应用方法对训练数据进行去重后,语言模型针对此类隐私攻击的安全性显著提高。综上,我们的结果促使在隐私敏感应用中更加关注去重,并重新评估现有隐私攻击的实用性。

关键词

引用

@article{arxiv.2202.06539,
  title  = {Deduplicating Training Data Mitigates Privacy Risks in Language Models},
  author = {Nikhil Kandpal and Eric Wallace and Colin Raffel},
  journal= {arXiv preprint arXiv:2202.06539},
  year   = {2022}
}

备注

ICML 2022 Camera Ready Version