RL Grokking 配方:RL 如何解锁并迁移 LLM 中的新算法
机器学习
2025-10-07 v2 计算与语言
摘要
仍是一个未决问题:大语言模型是否能够获得或概括超出其预训练或后训练参数中编码技能的真正新颖推理策略。为此,我们提出DELTA-Code -- Learnability and Transferrability in Algorithmic Coding 的分布式评估框架,该框架包含一组受控的人工编码问题族,旨�探讨两个根本性方面:学习性——通过强化学习(RL),大语言模型能否在足够尝试后解决预训练模型表现失败的大规模问题族(即pass@K=0)?——以及迁移性——若学习成功,这些技能能否系统性地迁移到超出分布(OOD)测试集中?与先前公开的编码数据集不同,DELTA通过模板化问题生成器隔离推理技能,并引入完全超出分布的问题族,这些问题族需要新颖策略而非工具调用或记忆化模式。我们的实验揭示了令人惊讶的grokking相位转变:在接近零奖励的长期训练后,RL训练的模型迅速攀升至接近完美的准确率。为实现对此前无法解决的问题族的学习,我们探讨了诸关键训练要素,如基于稠密奖励的分阶段预热、经验回放、课程训练以及验证式联动。除学习性外,我们利用DELTA评估迁移性或概括性,沿探索性、组合性和变革性轴向,以及跨族迁移。结果显示,在族内及复合技能方面均取得显著提升,但在变革性情形中仍存在薄弱环节。DELTA因此为探索RL驱动推理的极限提供了干净的测试平台,理解模型如何超越现有先验获取新算法技能提供了可能性。
引用
@article{arxiv.2509.21016,
title = {RL Grokking Recipe: How Does RL Unlock and Transfer New Algorithms in LLMs?},
author = {Yiyou Sun and Yuhan Cao and Pohao Huang and Haoyue Bai and Hannaneh Hajishirzi and Nouha Dziri and Dawn Song},
journal= {arXiv preprint arXiv:2509.21016},
year = {2025}
}