中文

Ellipsoid Control:基于良性潜在建模的白名单越狱防御

密码学与安全 2026-05-26 v1

摘要

表示工程(RepE)防御在大型语言模型(LLM)上对越狱攻击表现出强大的鲁棒性。然而,这些方法本质上依赖于黑名单监督:它们从有害或越狱数据中学习越狱到拒绝的激活转换,这些数据本质上是不完整且持续演变的。因此,RepE基于防御的性能严重依赖于收集的有害样本的质量和覆盖范围,使模型仍然 vulnerable to unseen attacks。这种依赖性也掩盖了拟合已知有害分布防御与保护良性潜在区域而无需估计有害分布防御之间的区别。我们采用相反的白名单视角,利用良性数据的可访问性和丰富性。目标是在确保无害输入不被错误拒绝的同时,elicitation arbitrary inputs 的拒绝。这将核心研究问题转变为:如何设计一种鲁棒的良性潜在保持机制,以保持良性潜在分布完整,同时elicitation拒绝?为此,我们提出Ellipsoid Control,一种测试时防御。它执行投影梯度下降,可elicitation arbitrary inputs 的拒绝,以提高防御效果。同时,从丰富的良性数据中拟合一个各向异性良性几何椭体,以约束更新以最小化良性潜在几何的扭曲。这种紧约束有助于保持模型实用性。在多个LLM、越狱攻击、良性任务和安全边界评估中,Ellipsoid Control consistently 提升了安全性,同时更好地保持了实用性,展示了白名单方法对于越狱防御的有效性。

关键词

引用

@article{arxiv.2605.24552,
  title  = {Ellipsoid Control: A White-list Jailbreak Defense via Benign Latent Modeling},
  author = {Luoyu Chen and Weiqi Wang and Zhiyi Tian and Feng Wu and Ahmed Asiri and Shui Yu},
  journal= {arXiv preprint arXiv:2605.24552},
  year   = {2026}
}

备注

Under review by TIFS