中文

超越红队测试:LLM 警戒分类器的形式化保证

机器学习 2026-05-12 v1

摘要

警戒分类器为生产语言模型提供防御措施,但尽管测试结果看起来有前景,却无法提供形式化保证。由于“有害行为”在离散输入空间中没有自然的规范化,标准的 epsilon-ball 属性在此领域不具备语义意义。我们通过将验证从离散输入空间转移到分类器的预激活空间来弥合这一差距,在该空间中将有害区域定义为包围已知有害提示表示的凸形状。由于 sigmoid 分类头是单调的,对整个区域的认证等价于对最差点的认证,这使得在 O(d) 时间内可获得无近似的闭式可信度证明。为对这些分类器进行形式化评估,我们提出两种区域构造方法:SVD 对齐的超矩形(yield exact SAT/UNSAT 证书),以及高斯混合模型(yield 概率性证书,覆盖语义上连贯的聚类)。将该框架应用于三个作者训练的警戒分类器(针对毒性领域),所有超矩形配置均返回 SAT,尽管实验指标看起来很高,仍暴露了所有分类器在可验证安全性方面的漏洞。概率性 GMM 证书也揭示了这些模型在表示有害性方面的结构稳定性差异。虽然 GPT-2 和 Llama-3.1-8B 在不同边界下分别保持约 90% 和 80% 的稳健覆盖率,但 BERT 的安全保证独具波动性。这种“覆盖坍缩”使其在最优阈值处降至 55%,仅通过采用极端保守的悲观阈值才能实现完整覆盖。这三种方法的结合提供了关于警戒分类器实际效果的新见解,超越了传统的红队测试。

关键词

引用

@article{arxiv.2605.10901,
  title  = {Beyond Red-Teaming: Formal Guarantees of LLM Guardrail Classifiers},
  author = {Nikita Kezins and Urbas Ekka and Pascal Berrang and Luca Arnaboldi},
  journal= {arXiv preprint arXiv:2605.10901},
  year   = {2026}
}