中文

存在但被重新缩放:从聊天到智能体的加性激活引导迁移

机器学习 2026-07-10 v1

摘要

加性激活引导(在生成过程中注入一个缩放的残差流方向)几乎完全在单轮聊天中校准,但其目标模型越来越多地被部署为使用工具 ReAct 智能体。我们首次对加性引导进行了系统的聊天到智能体迁移研究,在匹配信息设计中结合了行为测量和表示读出:相同的项目被呈现为纯聊天或 ReAct 工具使用情节,并带有匹配范数的随机方向对照,且每轮重新编码转录以排除 KV 缓存污染。迁移是真实的,但被重新缩放,正确的描述是一种分离:注入的方向在测试的每种设置和模型中几乎以全强度到达深层(三个模型家族的安装点智能体与聊天比率为 0.83-1.16),而行为耦合则因模型和上下文而异。在 Qwen2.5-7B 上,拒绝绕过向量在智能体中放大(T = 1.45,CI [1.20, 1.78],N = 300);在有力的统一协议分布中,耦合范围从放大(Gemma-2-9B T = 2.00)到衰减(Yi-1.5-9B T = 0.43,CI [0.29, 0.60]),没有通用常数,并且只有一个干净的衰减器与通用符号相对。同一轴的方向性消融不会放大(T = 0.93,CI 包含 1),而加性注入会放大(T = 1.50),这是 20.1 分的增益差异(CI [13.4, 26.8]),确定了一种加性特定机制。两个预注册工具收敛于将重新缩放定位到 ReAct 格式脚手架,在任何工具观察之前,而不是在稀释解释会预测的观察边界。安全影响是直接且不可预测的:智能体部署在某些模型上将基于引导的拒绝绕过放大高达 2.00 倍,而其他模型则衰减,因此部署不能假设给定模型在加性引导下是安全的。

关键词

引用

@article{arxiv.2607.09156,
  title  = {Present but Rescaled: Chat-to-Agent Transfer of Additive Activation Steering},
  author = {Lucas Pinto},
  journal= {arXiv preprint arXiv:2607.09156},
  year   = {2026}
}

备注

12 pages, 3 figures, 4 tables