识别与迁移推理关键神经元:通过激活引导提升 LLM 推理可靠性
计算与语言
2026-01-28 v1
摘要
尽管近期大型语言模型(LLM)展现出强大的推理能力,但在具有挑战性的任务上获得可靠性能通常需要后训练或计算成本高昂的采样策略,这限制了其实际效率。在本工作中,我们首先表明 LLM 中的一小部分神经元与推理正确性表现出强烈的预测相关性。基于这一观察,我们提出了 AdaRAS(Adaptive Reasoning Activation Steering,自适应推理激活引导),这是一种轻量级的测试时框架,通过选择性干预神经元激活来提升推理可靠性。AdaRAS 通过极性感知均值差准则识别推理关键神经元(Reasoning-Critical Neurons, RCN),并在推理过程中自适应地引导其激活,在增强错误推理轨迹的同时避免对已正确案例的性能退化。在 10 个数学和编程基准上的实验表明了持续的性能提升,包括在 AIME-24 和 AIME-25 上超过 13% 的增益。此外,AdaRAS 展现出跨数据集的强可迁移性以及对更强模型的可扩展性,在无需额外训练或采样成本的情况下超越了后训练方法。
引用
@article{arxiv.2601.19847,
title = {Identifying and Transferring Reasoning-Critical Neurons: Improving LLM Inference Reliability via Activation Steering},
author = {Fangan Dong and Zuming Yan and Xuri Ge and Zhiwei Xu and Mengqi Zhang and Xuanang Chen and Ben He and Xin Xin and Zhumin Chen and Ying Zhou},
journal= {arXiv preprint arXiv:2601.19847},
year = {2026}
}