差别化方向干预:一种规避 LLM 安全对齐的框架
密码学与安全
2025-11-25 v4 人工智能
机器学习
软件工程
摘要
安全对齐赋予大型语言模型 (LLM) 拒绝恶意请求的关键能力。先前的工作将这种拒绝机制建模为激活空间中的单一线性方向。我们认为这是一种过度简化,导致将两种功能上 distinct 的神经过程混合:危害检测与拒绝执行。在本工作中,我们将这种单一表示解构为危害检测方向和拒绝执行方向。凭借这一细粒度模型,我们引入差别化双向干预 (DBDI),一种新的白盒框架,精确在关键层 neutralize 安全对齐。DBDI 对拒绝执行方向应用自适应投影零化,同时通过直接驾驭抑制危害检测方向。广泛的实验表明,DBDI 在 Llama-2 等模型上超过了突出的作恶方法,实现最高达 97.88% 的攻击成功率。通过提供一种更细粒度且机制化的框架,本工作为深入理解 LLM 安全对齐提供了新的方向。
引用
@article{arxiv.2511.06852,
title = {Differentiated Directional Intervention A Framework for Evading LLM Safety Alignment},
author = {Peng Zhang and Peijie Sun},
journal= {arXiv preprint arXiv:2511.06852},
year = {2025}
}
备注
AAAI-26-AIA