中文

BARRIER:面向鲁棒信息擦除的有界激活区域方法

计算机视觉与模式识别 2026-05-18 v1

摘要

机器遗忘已到达一个关键瓶颈。传统的权重空间干预主要侧重于擦除目标概念,但往往无法防止其他重要表征被意外抑制。由于这些方法缺乏对中性概念保留的正式数学保证,导致严重的附带损害,即基本知识被遗忘。为避免性能退化,它们常常被迫采取保守的更新策略。我们提出 BARRIER(面向鲁棒信息擦除的有界激活区域方法),这是一个范式转换框架,将干预的焦点从静态模型权重转移到隐藏层激活的动态几何结构上。与现有方法不同,BARRIER 对基于奇异值分解(SVD)的激活空间投影使用区间算术(IA),将特定目标区域封装在一个有界超立方体内。通过仅在遗忘区间内驱动遗忘更新,并在补集上对模型响应进行数学界定,我们确保了对保留分布的严格保护。这种几何构造将知识保留从经验启发式方法转变为具有功能漂移概率尾界的形式化优化目标。至关重要的是,这种稳定性允许在遗忘区域内进行高度激进的遗忘更新。实证评估表明,BARRIER 在分类器和扩散模型上均达到了与最先进方法相当的权衡,在最大化目标概念擦除的同时,保护了所有其他表示的完整性。我们的代码可在 https://github.com/OneAndZero24/BARRIER 获取。

关键词

引用

@article{arxiv.2605.15737,
  title  = {BARRIER: Bounded Activation Regions for Robust Information Erasure},
  author = {Jan Miksa and Patryk Krukowski and Przemysław Spurek and Dawid Damian Rymarczyk and Marcin Sendera},
  journal= {arXiv preprint arXiv:2605.15737},
  year   = {2026}
}