面向安全保护的警戒空间:当安全敏感子空间遇上有害抗性零空间
人工智能
2025-10-28 v2
摘要
大型语言模型 (LLM) 在 diverse 任务中取得了显著的成功,但其在适应期间的安全对齐仍然脆弱。即使在良性数据或低秩适应上进行微调,预训练的安全行为也容易被损坏,导致模型产生有害响应。为此,我们提出了 GuardSpace,这是一个在微调期间保持安全对齐的警戒框架,包含两个关键组件:安全敏感子空间和有害抗性零空间。首先,我们使用协方差预条件奇异值分解显式地将预训练权重分解为与安全相关和与安全无关的组件,从安全无关的组件初始化低秩适配器,同时冻结与安全相关的组件以保留其关联的安全机制。其次,我们构建一个零空间投影器,以限制适配器更新不改变有害提示下的安全输出,从而维持原始的拒绝行为。在多个下游任务上对各种预训练模型进行实验,表明 GuardSpace 在性能上优于现有方法。值得注意的是,对 Llama-2-7B-Chat 在 GSM8K 上的微调,GuardSpace 比最新的方法 AsFT 表现更佳,将有害得分从 14.4% 降低到 3.6%,同时将准确率从 26.0% 提升到 28.0%。
引用
@article{arxiv.2510.14301,
title = {A Guardrail for Safety Preservation: When Safety-Sensitive Subspace Meets Harmful-Resistant Null-Space},
author = {Bingjie Zhang and Yibo Yang and Zhe Ren and Dandan Guo and Jindong Gu and Philip Torr and Bernard Ghanem},
journal= {arXiv preprint arXiv:2510.14301},
year = {2025}
}