通过无关表征坍缩(CIR)确保鲁棒且非破坏性的LLM遗忘
机器学习
2025-11-14 v2 人工智能
计算与语言
摘要
当前的遗忘与安全训练方法始终无法从语言模型中移除危险知识。我们识别出根本原因——遗忘的目标表征过于通用——并开发了一种高度选择性的技术,在保留通用性能的同时稳健地执行遗忘。我们的方法在激活值和模块输出梯度上执行PCA,以识别包含通用表征的子空间,然后在计算遗忘更新之前坍缩这些子空间,我们称之为无关表征坍缩(CIR)。这避免了遗忘通用知识,仅针对待遗忘事实特有的表征。在Llama-3.1-8B上遗忘生物和网络安全危害事实时,我们实现了比最佳基线方法(Circuit Breakers)高30倍的攻击后准确率降低,同时通用性能的扰动减少30倍,且每个事实耗时不到3 GPU秒。因此,通过在表征层面解耦有害和良性能力,CIR实现了鲁棒且非破坏性的遗忘。
引用
@article{arxiv.2509.11816,
title = {Collapse of Irrelevant Representations (CIR) Ensures Robust and Non-Disruptive LLM Unlearning},
author = {Filip Sondej and Yushi Yang},
journal= {arXiv preprint arXiv:2509.11816},
year = {2025}
}