私有记忆编辑:将记忆转化为防御以增强大型语言模型中的数据隐私
密码学与安全
2025-08-22 v1 人工智能
计算与语言
摘要
大型语言模型(LLM)具有记忆能力,因此在大量不受控制的数据中,可能会记忆个人身份信息(PII),这些信息不应被存储,也不应被泄露。在本文中,我们提出私有记忆编辑(PME),一种防止私有数据泄露的方法,将 LLM 的记忆能力这一表面上的局限性转化为强大的隐私防御策略。虽然针对 LLM 的攻击利用了对训练数据的先验知识,但我们的方法旨在利用同样的知识来使模型更加鲁棒。我们检测被记忆的个人身份信息(PII),然后通过编辑模型对其训练数据的知识来缓解对 PII 的记忆。我们验证了该过程在不影响底层语言模型的同时,使其对隐私训练数据提取攻击更加鲁棒。我们证明了 PME 可以在多种配置下有效减少泄露的 PII 数量,在某些情况下甚至将隐私攻击的准确率降至零。
引用
@article{arxiv.2506.10024,
title = {Private Memorization Editing: Turning Memorization into a Defense to Strengthen Data Privacy in Large Language Models},
author = {Elena Sofia Ruzzetti and Giancarlo A. Xompero and Davide Venditti and Fabio Massimo Zanzotto},
journal= {arXiv preprint arXiv:2506.10024},
year = {2025}
}
备注
To be published at ACL 2025 (Main)