中文

为何强化学习能泛化?大语言模型后训练的特征层面机制性研究

计算与语言 2026-04-29 v1

摘要

基于强化学习(RL)的后训练通常会提高大型语言模型(LLM)在训练领域之外的推理性能,而监督微调(SFT)则常常导致通用能力的遗忘。然而,这种对比背后的机制仍不清晰。为弥合这一差距,我们提出一种特征层面的机制性分析方法,用于受控实验设置下的 RL 泛化性研究, wherein RL-和 SFT-微调的模型均从相同的基础模型在相同的训练数据上进行训练。借助我们的可解释性框架,我们在共享特征空间中对齐跨模型的内部激活,并分析特征在后训练期间的演变。我们发现,SFT 快速引入大量高度专业化的特征,并在训练早期稳定;而 RL 则引发更为克制且持续演变的特征变化,大大保留了基础模型的表示。聚焦于 RL 成功但基础模型失败的样本,我们识别出一组紧凑、任务无关的特征,直接介导跨不同任务的泛化。特征层面的干预实验证明,这些特征在 RL 模型的泛化性能中具有因果作用:禁用这些特征会显著降低 RL 模型的泛化性能,而放大这些特征则提升基础模型的性能。代码已公开于 https://github.com/danshi777/RL-generalization。

关键词

引用

@article{arxiv.2604.25011,
  title  = {Why Does Reinforcement Learning Generalize? A Feature-Level Mechanistic Study of Post-Training in Large Language Models},
  author = {Dan Shi and Zhuowen Han and Simon Ostermann and Renren Jin and Josef van Genabith and Deyi Xiong},
  journal= {arXiv preprint arXiv:2604.25011},
  year   = {2026}
}

备注

ACL 2026 Main Conference