通过近似最优参数保护语言模型序列取消学习中的隐私
计算与语言
2024-06-21 v1
摘要
尽管语言模型 (LM) 在 various 任务上展现出卓越的能力,但它们可能容易受到提取攻击,这代表着重大的隐私风险。为缓解 LM 的隐私 concerns,机器取消学习已成为一个重要的研究领域,该领域用于使 LM 对其训练数据的某些部分选择性忘记。虽然完全重新训练模型将保证成功的取消学习和隐私保证,但对于 LM 来说这是不切实际的,因为这将耗时且资源密集。先前的工作高效地取消学习目标 token 序列,但在后续迭代中,LM 会显示出显着的性能下降。在本 work 中,我们提出了一种名为 Privacy Protection via Optimal Parameters (POP) 的新型取消学习方法,通过对参数施加 optimal 梯度更新来有效地从预训练 LM 中忘记目标 token 序列。灵感来自完全重新训练的梯度推导,我们近似出成功忘记目标序列同时保留其余训练数据知识的 optimal 训练目标。实验结果表明,POP 在 9 个分类和 4 个对话基准测试中展现出显著的 retention 性能,显著优于最新方法。此外,我们引入了 Remnant Memorization Accuracy,用于基于 token 概率度量隐私风险,并通过定性和定量分析验证其有效性。
引用
@article{arxiv.2406.14091,
title = {Protecting Privacy Through Approximating Optimal Parameters for Sequence Unlearning in Language Models},
author = {Dohyun Lee and Daniel Rim and Minseok Choi and Jaegul Choo},
journal= {arXiv preprint arXiv:2406.14091},
year = {2024}
}
备注
Accepted to ACL2024 findings