几何解缠记忆
机器学习
2026-02-03 v4 人工智能
计算与语言
摘要
大语言模型(LLM)可能内化私有或有害内容,催生了需要遗忘技术以删除忘却集合,同时保持保留知识。然而,遗忘更新常导致保留知识的持续性退化,形成顾虑与保留之间的持久性权衡。现有 LLM 遗忘方法往往是经验性的,而其他理论方法依赖离线特征构建,无法捕捉 LLM 中更新时忘却-保留相互作用。为此,我们致力于开发一种能在理论保障下降低忘却-保留权衡的 LLM 遗忘方法。我们从原理出发,将“无副作用”形式化为小参数更新下的局部保留不变性,并证明在优化器引起的几何下等价性:当且仅当更新方向与由保留梯度张成的子空间正交时,保留损失在局部上保持不变。基于此洞见,我们提出几何解缠记忆(GU),一种轻量且在理论上有保障的投影,可即插即用于现有基于梯度的遗忘方法,以缓解忘却-保留副作用。实验在 TOFU、MUSE 和 WMDP-cyber 上表明,GU 在遗忘方面提升了表现,同时降低了保留漂移。当添加到 SimNPO 时,可实现忘却提取强度(Extraction Strength, ES)提升最高 62%,保留 ES 提升 31%。我们已在 https://github.com/Lemutisme/Geometric-Unlearning 开源代码。
引用
@article{arxiv.2511.17100,
title = {Geometric-disentangelment Unlearning},
author = {Duo Zhou and Yuji Zhang and Tianxin Wei and Ruizhong Qiu and Ke Yang and Xiao Lin and Cheng Qian and Jingrui He and Hanghang Tong and Chengxiang Zhai and Heng Ji and Huan Zhang},
journal= {arXiv preprint arXiv:2511.17100},
year = {2026}
}
备注
26 Pages