通过全局优化归因与利用大语言模型中的安全向量
机器学习
2026-01-27 v1 密码学与安全
摘要
尽管大语言模型(LLMs)经过对齐以降低风险,但其安全护栏在面对越狱攻击时依然脆弱。这揭示了对构成安全机制的组件理解有限。现有方法依赖于假设组件独立贡献的局部贪婪归因。然而,它们忽略了LLMs中不同组件(如注意力头)之间的协同交互,这些组件共同作用于安全机制。我们提出用于安全向量提取的全局优化框架(GOSV),该框架通过对所有注意力头同时进行全局优化来识别安全关键的注意力头。我们采用两种互补的激活重修补策略:有害修补和零消融。这些策略识别出两组空间上截然不同且重叠度始终很低的安全向量,分别称为恶意注入向量和安全抑制向量,表明对齐后的LLMs为安全目的维持着独立的功能通路。通过系统分析,我们发现当所有模型中约30%的注意力头被重修补时,会发生完全的安全崩溃。基于这些见解,我们开发了一种新颖的推理时白盒越狱方法,通过激活重修补来利用所识别的安全向量。我们的攻击在所有测试模型上显著优于现有的白盒攻击,为所提出的GOSV框架在LLM安全可解释性方面的有效性提供了有力证据。
引用
@article{arxiv.2601.15801,
title = {Attributing and Exploiting Safety Vectors through Global Optimization in Large Language Models},
author = {Fengheng Chu and Jiahao Chen and Yuhong Wang and Jun Wang and Zhihui Fu and Shouling Ji and Songze Li},
journal= {arXiv preprint arXiv:2601.15801},
year = {2026}
}