中文

通过偏置-only 适配驾驭 LLM 推理

机器学习 2025-10-02 v3 人工智能

摘要

我们表明,通过强化学习训练单个 dd 维的驾驶向量(每层一个),而冻结所有基础权重,可在数学推理任务上达到与完全 RL 调谐推理模型相同的数据准确率。在 80 亿参数模型上,这仅增加约 0.0016%0.0016\% 的额外参数,并在多种基础模型和数学推理基准测试中复现性能。这些结果紧密控制了实现高级链路思维推理所需的参数预算,表明无需数百万适配器权重。最小的可训练 footprint 减少了优化器内存和 GPU 之间的通信,从而降低了微调的总体成本。此外,logit-lens 分析显示,所学向量放大了连贯 token 方向,为洞察模型内部计算提供了更清晰的视角。

关键词

引用

@article{arxiv.2505.18706,
  title  = {Steering LLM Reasoning Through Bias-Only Adaptation},
  author = {Viacheslav Sinii and Alexey Gorbatovski and Artem Cherepanov and Boris Shaposhnikov and Nikita Balagansky and Daniil Gavrilov},
  journal= {arXiv preprint arXiv:2505.18706},
  year   = {2025}
}

备注

EMNLP 2025