中文

大型语言模型的主动隐私遗忘:在保护 PII 的同时对模型效用的影响可忽略不计

计算与语言 2025-03-12 v2

摘要

随着大型语言模型(LLMs)的兴起,越来越多的研究认识到它们在恶意攻击下泄露个人身份信息(PII)的风险。尽管已有努力保护 LLM 中的 PII,但现有方法难以在隐私保护与维持模型效用之间取得平衡。在本文中,受认知科学中遗忘研究的启发,我们提出了一种新方法——主动隐私遗忘(PPA),以在保护 LLM 中 PII 的同时保持其效用。该机制通过主动识别并遗忘序列中与 PII 最密切相关的关键记忆,随后使用合适的替代记忆进行记忆植入,以维持 LLM 的功能。我们在多个模型上进行了评估,以保护常见 PII(如电话号码和物理地址)免受普遍的针对 PII 的攻击,证明了我们的方法相较于其他现有防御技术的优越性。结果表明,我们的 PPA 方法以 100% 的比例完全消除了电话号码暴露的风险,并将物理地址暴露的风险显著降低了 9.8% - 87.6%,同时保持了可比的模型效用性能。

关键词

引用

@article{arxiv.2502.17591,
  title  = {Proactive Privacy Amnesia for Large Language Models: Safeguarding PII with Negligible Impact on Model Utility},
  author = {Martin Kuo and Jingyang Zhang and Jianyi Zhang and Minxue Tang and Louis DiValentin and Aolin Ding and Jingwei Sun and William Chen and Amin Hass and Tianlong Chen and Yiran Chen and Hai Li},
  journal= {arXiv preprint arXiv:2502.17591},
  year   = {2025}
}

备注

ICLR'25 Poster. Project page and code is available at https://ppa-iclr2025.my.canva.site/