中文

语言模型中可学习的隐私神经元定位

机器学习 2024-05-21 v1 人工智能 计算与语言 密码学与安全

摘要

大型语言模型(LLM)记忆和泄露隐私信息(尤其是个人身份信息(PII))的担忧在社区中日益突出。为缓解隐私风险已做出许多努力,但LLM记忆PII的机制仍知之甚少。为弥补这一空白,我们引入了一种在LLM中精确定位PII敏感神经元(隐私神经元)的开创性方法。我们的方法采用可学习的二进制权重掩码,通过对抗训练定位LLM中负责记忆PII的特定神经元。我们的研究发现,PII被所有层中的一小部分神经元记忆,这体现了PII的特异性。此外,我们提出通过停用定位到的隐私神经元来验证PII风险缓解的潜力。定量和定性实验均证明了我们神经元定位算法的有效性。

关键词

引用

@article{arxiv.2405.10989,
  title  = {Learnable Privacy Neurons Localization in Language Models},
  author = {Ruizhe Chen and Tianxiang Hu and Yang Feng and Zuozhu Liu},
  journal= {arXiv preprint arXiv:2405.10989},
  year   = {2024}
}

备注

ACL 2024 main conference