中文

通过 SAE 解码探针向量对 35B MoE 语言模型进行行为引导:单一 agency 轴,而非五种特征

机器学习 2026-03-18 v1 计算与语言

摘要

我们在 Qwen 3.5-35B-A3B 一个 350 亿参数 Mixture-of-Experts 模型(采用混合 GatedDeltaNet/注意力架构)上训练了九个稀疏自编码器 (SAE),并用于识别和引导五种代理行为特征。我们的 метод训练线性探针在 SAE 活性值上,然后将探针权重通过 SAE 解码器投射回到模型本机激活空间,以获得连续引导向量。这绕过了 SAE 的 top-k 离散化,使我们能够在推理时进行细粒度的行为干预,而无需重新训练。在 1800 次代理 rollout 实验中(50 种情景 × 36 种条件),我们发现自主性引导在乘子 2 时达到 Cohen's d = 1.01 (p < 0.0001),将模型询问用户帮助的频率从 78% 降至主动执行代码和搜索网络。跨特征分析显示,所有五个引导向量主要调制单一的主导 agency 轴(即独立行动与依赖用户的倾向),特征特定的效应仅以次要方式在工具类型组成和剂量-反应形状中出现。工具使用向量引导行为 (d = 0.39);风险校准向量仅产生抑制。我们还表明仅在自回归解码时进行引导无效效果 (p > 0.35),提供了行为承诺在 GatedDeltaNet 架构中由 prefill 阶段计算的因果证据。

关键词

引用

@article{arxiv.2603.16335,
  title  = {Behavioral Steering in a 35B MoE Language Model via SAE-Decoded Probe Vectors: One Agency Axis, Not Five Traits},
  author = {Jia Qing Yap},
  journal= {arXiv preprint arXiv:2603.16335},
  year   = {2026}
}

备注

14 pages, 3 figures