OrthoEraser:基于耦合神经元正交投影的概念擦除方法
计算机视觉与模式识别
2026-03-13 v1 人工智能
计算机与社会
摘要
文本到图像 (T2I) 模型面临来自对抗诱导的显著安全风险,但现有概念擦除方法常因完全抑制特定神经元而导致针对良性属性的牵连损伤。这种现象源于敏感语义与良性语义呈非正交叠加,共享激活子空间,使其相应向量本质上被耦合。为此,我们提出 OrthoEraser,利用稀疏自编码器 (SAE) 实现高分辨率特征解耦,随后将擦除定义为保持良性流形不变性的解析正交化投影。OrthoEraser 首先利用 SAE 分解稠密激活并隔离敏感神经元,然后通过耦合神经元检测识别易受干预的非敏感特征。其核心创新在于一种解析梯度正交化策略,将擦除向量投影到耦合神经元的零空间,从而在正交上解耦敏感概念与已识别的关键良性子空间,有效保留非敏感语义。实验结果表明,OrthoEraser 在安全性方面实现了高精度擦除,有效移除有害内容,同时保持生成流形的完整性,显著优于 SOTA 基线。本文包含不安全模型的结果。
引用
@article{arxiv.2603.11493,
title = {OrthoEraser: Coupled-Neuron Orthogonal Projection for Concept Erasure},
author = {Chuancheng Shi and Wenhua Wu and Fei Shen and Xiaogang Zhu and Kun Hu and Zhiyong Wang},
journal= {arXiv preprint arXiv:2603.11493},
year = {2026}
}