对齐型大语言模型为何仍易被越狱:拒绝-逃逸方向、算子层次来源及安全-实用性权衡
密码学与安全
2026-05-12 v1 人工智能
摘要
对齐后的大语言模型 (LLM) 仍然 vulnerable to jailbreak 攻击。最近的机制性研究识别了与越狱成功相关的潜在特征和表示迁移,但留下了一个更根本的问题:为何对齐型 LLM 仍然易被越狱,其模型结构存在何种结构性脆弱性使其成为可能?我们通过连续输入转换视角来研究此问题。我们的理论发现,对齐型模型仍可 exhibit 拒绝-逃逸方向 (RED):围绕有害输入的局部扰动方向,将模型行为从拒绝转向回答,同时保持模型的有害语义解释。从这个角度看,越狱不仅是成功的离散提示构建,还可理解为通过在 RED 上连续扰动有害输入所引发的拒绝-回答行为转换。我们随后证明,RED 可精确分解为模型算子结构中算子层次来源的贡献,并识别归一化、残差连接和终端来源作为分析受约束的算子层次来源。要消除 RED,共享的表达模块——自注意力和 MLP——必须在保留支持良性响应机制的同时消除这些分析受约束来源的贡献。这些竞争性要求导致条件安全-实用性权衡。实验在多个模型和攻击方法下从两个互补视角分析 RED,表明增加 token 维度可暴露 RED,而成功的越狱则表现出拒绝-回答转变,基本与终端来源贡献一致。
引用
@article{arxiv.2605.08878,
title = {Why Do Aligned LLMs Remain Jailbreakable: Refusal-Escape Directions, Operator-Level Sources, and Safety-Utility Trade-off},
author = {Yu Chen and Yuanhao Liu and Qi Cao},
journal= {arXiv preprint arXiv:2605.08878},
year = {2026}
}
备注
40 pages, 45 figures