中文

Constitutional Classifiers++: Efficient Production-Grade Defenses against Universal Jailbreaks

密码学与安全 2026-01-09 v1 人工智能

摘要

我们引入了增强版Constitutional Classifiers,与上一代防御相比,它以大幅降低的计算成本和拒绝率提供生产级的越狱鲁棒性。我们的系统结合了几个关键见解。首先,我们开发了交换分类器,在完整的对话上下文中评估模型响应,这解决了上一代系统孤立检查输出时的漏洞。其次,我们实现了两阶段分类器级联,其中轻量级分类器筛选所有流量,仅将可疑交换升级到更昂贵的分类器。第三,我们训练了高效的线性探针分类器,并将其与外部分类器集成,以同时提高鲁棒性并降低计算成本。这些技术共同产生了一个生产级系统,与我们的基线交换分类器相比,计算成本降低了40倍,同时在生产流量上保持0.05%的拒绝率。通过超过1,700小时的广泛红队测试,我们展示了对通用越狱的强大保护——对该系统的任何攻击都未能成功诱导出与无防御模型在细节上相当的、对所有八个目标查询的响应。我们的工作确立了Constitutional Classifiers作为大型语言模型的实用且高效的防护措施。

关键词

引用

@article{arxiv.2601.04603,
  title  = {Constitutional Classifiers++: Efficient Production-Grade Defenses against Universal Jailbreaks},
  author = {Hoagy Cunningham and Jerry Wei and Zihan Wang and Andrew Persic and Alwin Peng and Jordan Abderrachid and Raj Agarwal and Bobby Chen and Austin Cohen and Andy Dau and Alek Dimitriev and Rob Gilson and Logan Howard and Yijin Hua and Jared Kaplan and Jan Leike and Mu Lin and Christopher Liu and Vladimir Mikulik and Rohit Mittapalli and Clare O'Hara and Jin Pan and Nikhil Saxena and Alex Silverstein and Yue Song and Xunjie Yu and Giulio Zhou and Ethan Perez and Mrinank Sharma},
  journal= {arXiv preprint arXiv:2601.04603},
  year   = {2026}
}