强化学习后训练如何诱导技能组合?以计时计分任务为例
机器学习
2025-12-02 v1
摘要
尽管强化学习 (RL) 成功增强了大型语言模型的推理能力,但其在促进组合化泛化 (即从已知组件合成新技能的能力) 中的作用常被等同于仅进行长度泛化。为此,我们研究 RL 后训练对技能组合的教学内容,以及组合结构如何影响技能迁移。我们聚焦于计时计分任务 (给定 n 个数字和一个目标值,构建一个评估结果为目标值的表达式),并将模型解决方案分析为表达式树,其中每个子树对应可重用的子任务,从而可视为一种“技能”。通过跟踪树形状及其在训练期间的成功率,我们发现:(i) 对更大 n 值以及不可见树形状的超出分布 (OOD) 泛化,表明子任务的组合式重用;(ii) 学习可行性的结构依赖性层次——模型先掌握浅层平衡树 (子任务间工作量较为平衡),再掌握深层不平衡树,对右侧偏重结构持续脆弱,即使该结构的组合深度与某些左侧偏重结构相同。我们的诊断揭示了学习内容、学习顺序以及泛化失败的地方,阐明了 RL 后训练如何诱导超出标准指标如 pass@k 所揭示的 OOD 泛化。
引用
@article{arxiv.2512.01775,
title = {How Does RL Post-training Induce Skill Composition? A Case Study on Countdown},
author = {Simon Park and Simran Kaur and Sanjeev Arora},
journal= {arXiv preprint arXiv:2512.01775},
year = {2025}
}