当安全几何崩塌:基于代理的守护模型微调漏洞
机器学习
2026-05-06 v1 人工智能
密码学与安全
摘要
在完全良性数据上微调的守护模型可以丧失所有安全对齐——并非通过对抗性操纵,而是通过标准的域专化。我们在三个专为设计的安全分类器——LlamaGuard、WildGuard 和 Granite Guardian——上进行测试,这些模型部署在智能体AI管道中作为保护层,并展示其源于隐含安全几何的破坏:即结构化的有害—良性表示边界,其指导分类。我们通过对类条件激活差异进行奇异值分解(SVD)提取每层的安全子空间,并跟踪该边界在良性微调下的演变。Granite Guardian 完全崩溃——拒绝率从85%降至0%,CKA降至零,且100%的输出变得模糊——其严重程度超过先前在通用LLM上的发现,这由专化假设解释:集中化的安全表示在效率方面很好,但极易产生灾难性脆弱性。为缓解此问题,我们提出了Fisher加权安全子空间正则化(Fisher-Weighted Safety Subspace Regularization, FW-SSR),这是一种训练时惩罚,结合(i)来自对角Fisher信息的曲率感知方向权重和(ii)随任务-安全梯度冲突自适应缩放的。FW-SSR在Granite Guardian上恢复了75%的拒绝率(CKA=0.983),将WildGuard的攻击成功率降至3.6%——低于未修改的基线——通过积极锐化安全子空间而非仅仅锚定其。针对所有三个模型,结构化表示几何(CKA、Fisher得分)比绝对位移指标更可靠地预测安全行为,确立了几何基于的监控是智能体部署中守护模型评估的必要组成部分。
引用
@article{arxiv.2605.02914,
title = {When Safety Geometry Collapses: Fine-Tuning Vulnerabilities in Agentic Guard Models},
author = {Ismail Hossain and Sai Puppala and Jannatul Ferdaus and Md Jahangir Alam and Yoonpyo Lee and Syed Bahauddin Alam and Sajedul Talukder},
journal= {arXiv preprint arXiv:2605.02914},
year = {2026}
}
备注
This paper got accepted for AAAI 2026 Summer Symposium Series