机制化引导揭示大语言模型在对抗情境下的层级特征脆弱性
计算与语言
2026-04-28 v1 人工智能
摘要
大型语言模型(LLM)尽管经过安全对齐仍可能被越狱以生成有害输出。现有攻击表明了这种脆弱性,但未揭示其背后的内部机制。本研究询问越狱成功是否由可识别的内部特征驱动,而非仅由提示词决定。我们为 Gemma-2-2B 提出了一个三阶段管道,使用 BeaverTails 数据集。第一阶段通过子空间相似性从对抗性响应中提取概念对齐的标记。第二阶段应用三种特征分组策略(聚类、层次链接和单标记驱动)在所有 26 层模型中识别 SAE 特征子组。第三阶段通过放大来自每个识别子组中最顶层的特征来引导模型,并使用标准化的 LLM-judge 评分协议测量有害性得分的变化。在三种方法中,来自层级 [16-25] 的特征相对更易受到引导。所有三种方法均确认,中后期层的特征子组对不安全输出更为负责。这些结果表明,Gemma-2-2B 的越狱脆弱性局限于中后期层的特征子组,这表明针对性的特征级干预可能比当前基于提示词的防御更具原则性地实现对抗鲁棒性。
引用
@article{arxiv.2604.23130,
title = {Mechanistic Steering of LLMs Reveals Layer-wise Feature Vulnerabilities in Adversarial Settings},
author = {Nilanjana Das and Manas Gaur},
journal= {arXiv preprint arXiv:2604.23130},
year = {2026}
}