我简直不敢相信它不够稳健:安全分类器在嵌入漂移下的灾难性崩溃
机器学习
2026-03-03 v1 计算与语言
摘要
指令调优推理模型日益增加地部署于带有安全分类器的系统中,这些分类器基于冻结嵌入训练,假设表示在模型更新之间保持稳定。我们系统性地调查了这一假设,发现其失败:规模为 的归一化扰动(对应嵌入球面上的约 角度漂移)将分类器性能从 降至 ROC-AUC。关键的是,平均置信度仅下降 ,产生危险的静默失效,其中 的误分类发生在高置信度下,击破标准监控。我们进一步表明,指令调优模型比基础模型表现出 20\% 更差的类别可分离性,这使得对齐系统反而更难以保护。我们的发现揭示了生产 AI 安全架构中的根本脆弱性,并挑战了安全机制在模型版本间可迁移的假设。
引用
@article{arxiv.2603.01297,
title = {I Can't Believe It's Not Robust: Catastrophic Collapse of Safety Classifiers under Embedding Drift},
author = {Subramanyam Sahoo and Vinija Jain and Divya Chaudhary and Aman Chadha},
journal= {arXiv preprint arXiv:2603.01297},
year = {2026}
}
备注
Accepted at the ICBINB: Where LLMs Need to Improve workshop at ICLR 2026. 12 pages and 3 Figures