强化学习如何影响语言模型:招募功能福利轴
机器学习
2026-05-29 v1 计算与语言
摘要
强化学习如何塑造语言模型的内部表示?我们提供证据表明,RL 招募了一种 pre-existing 的功能福利表示:一种对系统表现相对于其目标的好坏程度的估计。我们在一种新型、语义中性的迷宫环境中训练了几个语言模型。随后我们提取奖励和惩罚轨迹的概念向量,并在与迷宫环境无关的设置中评估这些向量。惩罚向量表现为负面福利表示:它促进失败和不可能 token,与负面情感概念对齐,负向跟踪目标实现,并通过引导产生负面自报告、病态回溯、拒绝和不确定性。正奖励向量呈其镜像图像,两者几乎成反向。这些效应在控制瓷砖到奖励映射、规模、指令微调、RL 训练算法、模型家族以及 LoRA 与全参数微调方面均具有鲁棒性,并且在我们将 RL 替换为监督微调后仍大部分持续。重要的是,这些向量在模型尚未进行迷宫训练前即有效。结合我们观察到的这些效应也出现在仅预训练模型中的观察,我们因此认为,这种功能福利轴在 post-training 之前已存在:它被招募而非被创建,由 post-training 所塑造。尽管我们对任何福利经验没有任何主张,但该轴表明最小化奖励信号可通过招募已存在的福利类表示广泛影响模型行为,对可解释性、post-training 动态和对齐具有启示意义。
引用
@article{arxiv.2605.30232,
title = {How's it going? Reinforcement learning in language models recruits a functional welfare axis},
author = {Andy Q Han and David J. Chalmers and Pavel Izmailov},
journal= {arXiv preprint arXiv:2605.30232},
year = {2026}
}
备注
81 pages, 43 figures, 32 tables