小向量,大影响:基于驾驶向量的 RL 引导推理机制性研究
机器学习
2026-02-03 v4
摘要
推理训练如何重塑大语言模型内部计算机制尚不清晰。我们研究了插入基础模型残差流中的轻量级驾驶向量,并以强化学习目标进行训练。这些向量在解释大量完整微调性能提升的同时,保持了小型可添加干预的可解释性。我们发现:(i) 最后一层驾驶向量类似于集中在第一个生成标记上的标记替换偏差,持续增强诸如“To”和“Step”等标记;(ii) 倒数第二层向量保持注意力模式基本不变,主要通过 MLP 和解码层操作,优先提升过程词和结构符号;(iii) 驾驶向量可传输至同一系列中的其他模型。综上,这些结果深化了对训练驾驶向量如何塑造计算的理解,应为激活工程及推理模型研究的未来工作提供指导。
引用
@article{arxiv.2509.06608,
title = {Small Vectors, Big Effects: A Mechanistic Study of RL-Induced Reasoning via Steering Vectors},
author = {Viacheslav Sinii and Nikita Balagansky and Gleb Gerasimov and Daniil Laptev and Yaroslav Aksenov and Vadim Kurochkin and Alexey Gorbatovski and Boris Shaposhnikov and Daniil Gavrilov},
journal= {arXiv preprint arXiv:2509.06608},
year = {2026}
}
备注
Preprint