通过偏置-only 适配驾驭 LLM 推理
机器学习
2025-10-02 v3 人工智能
摘要
我们表明,通过强化学习训练单个 维的驾驶向量(每层一个),而冻结所有基础权重,可在数学推理任务上达到与完全 RL 调谐推理模型相同的数据准确率。在 80 亿参数模型上,这仅增加约 的额外参数,并在多种基础模型和数学推理基准测试中复现性能。这些结果紧密控制了实现高级链路思维推理所需的参数预算,表明无需数百万适配器权重。最小的可训练 footprint 减少了优化器内存和 GPU 之间的通信,从而降低了微调的总体成本。此外,logit-lens 分析显示,所学向量放大了连贯 token 方向,为洞察模型内部计算提供了更清晰的视角。
引用
@article{arxiv.2505.18706,
title = {Steering LLM Reasoning Through Bias-Only Adaptation},
author = {Viacheslav Sinii and Alexey Gorbatovski and Artem Cherepanov and Boris Shaposhnikov and Nikita Balagansky and Daniil Gavrilov},
journal= {arXiv preprint arXiv:2505.18706},
year = {2025}
}
备注
EMNLP 2025