基于模型行为几何的越狱易感性预测与缓解
密码学与安全
2026-05-27 v1 人工智能
机器学习
摘要
评估和缓解生成式系统对越狱攻击的易感性,是其安全部署的关键。鉴于可部署系统的数量庞大,完整的按配置评估和优化是不可行的。本文我们形式化化一种模型群体的行为几何,通过利用先前评估和防御的模型,支持高效的易感性预测以及群体间防御的有效迁移。我们将该框架应用于 79 个模型(覆盖 24 个提供商)以及单个基模型的 100 种系统配置。简单的方法利用行为几何即可实现 0.94 的 AUPRC,以约 98% 更少的探针实现易感性检测。利用行为几何选择从哪个模型 transferring 优化后的防御,比同提供商分配(提升 2%,p=0.03)在不增加探针成本的情况下表现更好,且仅需 3 个模型即可覆盖整个群体。结果对超参数选择和评判器鲁棒。
引用
@article{arxiv.2605.26409,
title = {Jailbreak susceptibility prediction and mitigation via the behavioral geometry of models},
author = {Hayden Helm and Xiaodong Liu and Weiwei Yang},
journal= {arXiv preprint arXiv:2605.26409},
year = {2026}
}