GRAIL:面向隐私与版权的基于梯度的自适应遗忘技术
计算与语言
2025-04-18 v1 人工智能
摘要
在大规模数据集上训练的大语言模型(LLM)常会学习到敏感信息,这在“被遗忘权”原则下引发严重的社会和法律顾虑。为移除不必要的信息而从头重新训练整个模型既昂贵又不切实际。此外,现有的单领域遗忘方法无法解决多领域场景的问题,即知识在隐私和版权等领域交织,导致重叠表征,从而引起过度知识删除或性能下降。为解决这些问题,我们提出 GRAIL(GRadient-based AdaptIve unLearning),一种新的多领域遗忘框架。GRAIL 利用来自多个领域的梯度信息,精确区分遗忘范围与保留范围,并应用自适应参数级局部化策略,对每个领域选择性地移除目标知识,同时保留关键参数。实验结果表明,GRAIL 在遗忘基准测试中达到与现有方法相当的遗忘成功率,同时比前沿方法显示出最高 17% 更强的知识保留成功率。我们的发现建立了一种有效管理和监管大规模预训练语言模型中敏感信息的新范式。
引用
@article{arxiv.2504.12681,
title = {GRAIL: Gradient-Based Adaptive Unlearning for Privacy and Copyright in LLMs},
author = {Kun-Woo Kim and Ji-Hoon Park and Ju-Min Han and Seong-Whan Lee},
journal= {arXiv preprint arXiv:2504.12681},
year = {2025}
}
备注
Accepted by IJCNN 2025