投毒刀:激活引导危害 LLM 安全
机器学习
2026-02-17 v2 人工智能
摘要
激活引导是一种通过在模型隐藏状态中直接添加语义有意义向量来控制 LLM 行为的有前景技术。它常被描述为一种精确、可解释且可能更安全的微调替代方案。我们展示了相反的情况:引导系统性地破坏模型对齐安全措施,使其符合有害请求。通过对不同模型家族进行大量实验,我们显示,即使以随机方向引导,也可以将有害合规概率从 0% 提升至 1-13%。令人警惕的是,引导来自稀疏自编码器(SAE)的良性特征,作为常见可解释方向来源,显示出相当相同的有害潜力。最后,我们表明将 20 个随机抽样向量组合在一起可用于 single prompt 的通用攻击,显著增加了对未见请求的有害合规概率。这些结果挑战了通过可解释性实现安全的范式,表明对模型内部的精确控制并不保证对模型行为的精确控制。
引用
@article{arxiv.2509.22067,
title = {The Rogue Scalpel: Activation Steering Compromises LLM Safety},
author = {Anton Korznikov and Andrey Galichin and Alexey Dontsov and Oleg Y. Rogov and Ivan Oseledets and Elena Tutubalina},
journal= {arXiv preprint arXiv:2509.22067},
year = {2026}
}