中文

DEPN:预训练语言模型中隐私神经元的检测与编辑

密码学与安全 2023-12-06 v2 计算与语言

摘要

在海量数据上预训练的大语言模型捕获了训练数据中的丰富知识与信息。先前研究揭示的预训练语言模型的数据记忆与反刍能力带来了数据泄露的风险。为有效降低这些风险,我们提出一个框架 DEPN,用于在预训练语言模型中检测与编辑隐私神经元(Detect and Edit Privacy Neurons),部分受知识神经元与模型编辑的启发。在 DEPN 中,我们引入一种称为隐私神经元检测器的新方法,以定位与隐私信息相关的神经元,然后通过将其激活置零来编辑这些检测到的隐私神经元。此外,我们提出一种隐私神经元聚合器,以批处理方式消除隐私信息的记忆。实验结果表明,我们的方法能在不损害模型性能的情况下显著且高效地降低隐私数据泄露的暴露。另外,我们从模型规模、训练时间、提示、隐私神经元分布等多个角度实证展示了模型记忆与隐私神经元之间的关系,说明了我们方法的鲁棒性。

关键词

引用

@article{arxiv.2310.20138,
  title  = {DEPN: Detecting and Editing Privacy Neurons in Pretrained Language Models},
  author = {Xinwei Wu and Junzhuo Li and Minghui Xu and Weilong Dong and Shuangzhi Wu and Chao Bian and Deyi Xiong},
  journal= {arXiv preprint arXiv:2310.20138},
  year   = {2023}
}

备注

EMNLP 2023