中文

我简直不敢相信它不够稳健:安全分类器在嵌入漂移下的灾难性崩溃

机器学习 2026-03-03 v1 计算与语言

摘要

指令调优推理模型日益增加地部署于带有安全分类器的系统中,这些分类器基于冻结嵌入训练,假设表示在模型更新之间保持稳定。我们系统性地调查了这一假设,发现其失败:规模为 σ=0.02\sigma=0.02 的归一化扰动(对应嵌入球面上的约 11^\circ 角度漂移)将分类器性能从 85%85\% 降至 50%50\% ROC-AUC。关键的是,平均置信度仅下降 14%14\%,产生危险的静默失效,其中 72%72\% 的误分类发生在高置信度下,击破标准监控。我们进一步表明,指令调优模型比基础模型表现出 20\% 更差的类别可分离性,这使得对齐系统反而更难以保护。我们的发现揭示了生产 AI 安全架构中的根本脆弱性,并挑战了安全机制在模型版本间可迁移的假设。

关键词

引用

@article{arxiv.2603.01297,
  title  = {I Can't Believe It's Not Robust: Catastrophic Collapse of Safety Classifiers under Embedding Drift},
  author = {Subramanyam Sahoo and Vinija Jain and Divya Chaudhary and Aman Chadha},
  journal= {arXiv preprint arXiv:2603.01297},
  year   = {2026}
}

备注

Accepted at the ICBINB: Where LLMs Need to Improve workshop at ICLR 2026. 12 pages and 3 Figures