中文

旋转控制遗忘:利用认知旋转空间量化与控制大语言模型的持续遗忘

机器学习 2026-01-06 v3 计算与语言

摘要

随着大语言模型(LLM)日益普及,其安全漏洞已引起关注。机器遗忘被引入以通过移除不良数据的影响来缓解这些风险。然而,现有方法不仅依赖保留数据集来保持模型效用,而且在持续遗忘请求下会遭受累积的灾难性效用损失。为解决这一困境,我们提出了一种名为旋转控制遗忘(RCU)的新方法,该方法利用 RCU 的旋转显著性权重来量化和控制持续遗忘过程中的遗忘程度。我们设计了斜对称损失来构建认知旋转空间的存在性,其中旋转角度的变化可以模拟持续遗忘过程。此外,我们设计了一种正交旋转轴正则化,为持续的遗忘请求强制施加相互垂直的旋转方向,从而有效最小化干扰并解决累积的灾难性效用损失。在多个数据集上的实验证实,我们的方法无需保留数据集即可达到 SOTA 性能。

关键词

引用

@article{arxiv.2509.25743,
  title  = {Rotation Control Unlearning: Quantifying and Controlling Continuous Unlearning for LLM with The Cognitive Rotation Space},
  author = {Xiang Zhang and Kun Wei and Xu Yang and Jiahua Li and Su Yan and Cheng Deng},
  journal= {arXiv preprint arXiv:2509.25743},
  year   = {2026}
}