中文

激活引导的内在抵抗性

机器学习 2026-02-09 v1 人工智能 计算与语言

摘要

大型语言模型在推理过程中可抵抗任务不匹配的激活引导,尽管引导仍然活跃,但模型有时会在生成过程中恢复,以产生改进的响应。我们称这种现象为内在引导抵抗性(ESR)。使用稀疏自编码器(SAE)潜在变量引导模型激活,我们发现 Llama-3.3-70B 显示出显著的 ESR,而来自Llama-3和Gemma-2系列的较小模型则表现出这种现象的频率较低。我们识别出 26 个在 off-topic 内容期间激活不同的 SAE 潜在变量,并与 ESR 在 Llama-3.3-70B 中具有因果关系。零消除这些潜在变量可将多次尝试率降低 25%,提供了针对专用内部一致性检查电路的因果证据。我们展示了 ESR 可通过提示和训练来增强:包含自我监控指令的元提示显著提高了 Llama-3.3-70B 的多次尝试率(提升 4 倍),而通过在自我纠正示例上进行微调可在较小模型中诱导类似 ESR 的行为。这些发现具有双重意义:ESR 可防止对抗性操控,但也可能干扰依赖激活引导的有益安全干预。理解和控制这些抵抗机制对开发透明且可控的 AI 系统至关重要。代码已发布于 github.com/agencyenterprise/endogenous-steering-resistance。

关键词

引用

@article{arxiv.2602.06941,
  title  = {Endogenous Resistance to Activation Steering in Language Models},
  author = {Alex McKenzie and Keenan Pepper and Stijn Servaes and Martin Leitgab and Murat Cubuktepe and Mike Vaiana and Diogo de Lucena and Judd Rosenblatt and Michael S. A. Graziano},
  journal= {arXiv preprint arXiv:2602.06941},
  year   = {2026}
}