知而不行:大型语言模型中安全机制的解耦几何结构
密码学与安全
2026-03-16 v2 人工智能
机器学习
摘要
安全对齐通常被概念化为一个单一过程,其中有害性检测自动触发拒绝。然而,越狱攻击的持续存在表明存在一种基本的机制解耦。我们提出了**解耦安全假说(DSH)**,认为安全计算在两个不同的子空间上运行:一个“识别轴”(,“知”)和一个“执行轴”(,“行”)。我们的几何分析揭示了一种普遍的“反射到解离”演化,其中这些信号从早期层的对抗性纠缠转变为深层层的结构独立性。为验证这一点,我们引入了“双重差分提取”和“自适应因果引导”。利用我们策划的\textsc{AmbiguityBench},我们证明了因果双重分离,有效地创造了一种“知而不行”的状态。至关重要的是,我们利用这种解耦提出了**拒绝擦除攻击(REA)**,该攻击通过外科手术式地切除拒绝机制,实现了最先进的攻击成功率。此外,我们揭示了一个关键的架构差异,对比了Llama3.1的“显式语义控制”与Qwen2.5的“潜在分布式控制”。代码和数据集可在https://anonymous.4open.science/r/DSH获取。
引用
@article{arxiv.2603.05773,
title = {Knowing without Acting: The Disentangled Geometry of Safety Mechanisms in Large Language Models},
author = {Jinman Wu and Yi Xie and Shen Lin and Shiqian Zhao and Xiaofeng Chen},
journal= {arXiv preprint arXiv:2603.05773},
year = {2026}
}