中文

$\textbf{AGT$^{AO}$}$:基于对抗门控训练与自适应正交的鲁棒稳定 LLM 忘却

机器学习 2026-02-03 v1 计算与语言

摘要

虽然大型语言模型(LLMs)已实现显著的能力,但它们不小心地记忆了敏感数据,构成了严重的隐私和安全风险。机器忘却是缓解这些风险的关键,但现有方法面临根本性困境:激进的忘却会引发灾难性遗忘而损害模型实用性,而保守的策略则可能留下浅层遗忘,使模型仍易受对抗恢复威胁。为解决这一权衡,我们提出了 \textbf{AGT^{AO}}(Adversarial Gating Training with Adaptive Orthogonality,基于对抗门控训练与自适应正交),一个统一的框架,旨在实现鲁棒的抹除与实用性的平衡。具体而言,我们引入 自适应正交(Adaptive Orthogonality, AO)\textbf{自适应正交(Adaptive Orthogonality, AO)} 以动态缓解忘却目标与保留目标之间的几何梯度冲突,从而最小化意外的知识退化。同时,对抗门控训练(Adversarial Gating Training, AGT)\textbf{对抗门控训练(Adversarial Gating Training, AGT)} 将忘却建模为潜在空间的 min-max 游戏,采用基于课程的门控机制模拟并抵消内部的恢复尝试。大量实验表明,\textbf{AGT^{AO}} 在忘却有效性(KUR \approx 0.01)和模型实用性(MMLU 58.30)之间实现了卓越的平衡。代码已公开于 https://github.com/TiezMind/AGT-unlearning。

关键词

引用

@article{arxiv.2602.01703,
  title  = {$\textbf{AGT$^{AO}$}$: Robust and Stabilized LLM Unlearning via Adversarial Gating Training with Adaptive Orthogonality},
  author = {Pengyu Li and Lingling Zhang and Zhitao Gao and Yanrui Wu and Yuxuan Dong and Huan Liu and Bifan Wei and Jun Liu},
  journal= {arXiv preprint arXiv:2602.01703},
  year   = {2026}
}