中文

REVS:通过词汇空间秩编辑实现语言模型中的敏感信息遗忘

计算与语言 2025-09-09 v6

摘要

语言模型(LM)可能会无意中记忆并泄露训练数据中出现的敏感或可识别个人身份信息(PII),从而引发隐私问题。当前解决此问题的方法涉及成本高昂的数据集清洗,或通过遗忘和模型编辑进行模型过滤,这些方法可能被提取攻击绕过。我们提出REVS,一种新颖的、基于非梯度的方法,用于从LM中遗忘敏感信息。REVS识别并修改与构成敏感信息的组成令牌相关的一小部分神经元。为了在真正的敏感信息上充分评估我们的方法,我们整理了三个数据集:模型自然记忆的电子邮件和URL数据集,以及我们调整模型使其记忆的合成社会安全号码数据集。与其他方法相比,REVS在遗忘敏感信息和抵抗提取攻击方面表现出优越的性能,同时保持了底层模型的完整性。

关键词

引用

@article{arxiv.2406.09325,
  title  = {REVS: Unlearning Sensitive Information in Language Models via Rank Editing in the Vocabulary Space},
  author = {Tomer Ashuach and Martin Tutek and Yonatan Belinkov},
  journal= {arXiv preprint arXiv:2406.09325},
  year   = {2025}
}

备注

ACL 2025 Findings, 24 pages, 4 figures