分析驾驶向量的安全陷阱
密码学与安全
2026-03-26 v1 计算与语言
摘要
激活引导已成为一种无需权重更新即可塑造大语言模型 (LLM) 行为的强大工具。尽管其固有的脆弱性和不可靠性已为人所知,但其安全影响仍未得到充分探讨。在本工作中,我们对使用对比激活添加 (Contrastive Activation Addition, CAA) 方法获取的引导向量进行系统的安全审计,并在统一的评估协议下进行分析。我们以 JailbreakBench 作为基准,展示了引导向量持续影响越狱攻击成功率,简单基于模板的攻击会导致更强的放大效应。在不同 LLM 家族和规模中,针对特定行为的引导会使模型的攻击成功率 (ASR) 增加最高可达 57% 或降低最高可达 50%。我们将这一现象归因于引导向量与拒绝行为潜在方向之间的重叠。因此,我们提供了该发现的可追溯解释。我们的结果揭示了 LLM 中这一安全差距的此前未被观察到的来源,凸显了可控性与安全性之间的权衡。
引用
@article{arxiv.2603.24543,
title = {Analysing the Safety Pitfalls of Steering Vectors},
author = {Yuxiao Li and Alina Fastowski and Efstratios Zaradoukas and Bardh Prenkaj and Gjergji Kasneci},
journal= {arXiv preprint arXiv:2603.24543},
year = {2026}
}