角度不说话:通过模型自身信号解锁训练高效强化学习
机器学习
2025-09-30 v2 人工智能
摘要
当前用于大语言模型(LLMs)的强化微调(RFT)范式因均匀数据抽样下重复查询的冗余暴露而存在样本低效。虽然先前工作通过启发式难度度量标准探索课程学习,但这些策略因忽视模型自身产生的内在学习信号而受限,导致次优训练体系。本文识别了一种称为 angle concentration 的模型内在信号,有效反映 LLM 从特定数据学习的能力。我们理论和经验上证明了 token 隐藏状态向量的角度分布与结果梯度之间的相关性,揭示了对 angle concentration 更高的数据具有学习偏好的特征。灵感来自这一发现,我们提出了 GAIN-RL,即 Gradient-driven Angle-Informed Navigated RL 框架。通过利用模型的内在 angle concentration 信号,GAIN-RL 在每个 epoch 中动态选择训练数据,确保始终产生有影响的梯度更新,从而显著提升整体训练效率。经验评估显示,GAIN-RL(GRPO)在 diverse 数学和编码任务上实现了 2.5 倍以上的训练效率提升,且在不同模型规模下表现良好。此外,GAIN-RL(GRPO)的高效抽样实现了数据高效训练,仅用原始 GRPO 的一半数据即可获得更好性能。代码已发布于 https://github.com/wangqinsi1/GAINRL/tree/main。
引用
@article{arxiv.2506.02281,
title = {Angles Don't Lie: Unlocking Training-Efficient RL Through the Model's Own Signals},
author = {Qinsi Wang and Jinghan Ke and Hancheng Ye and Yueqian Lin and Yuzhe Fu and Jianyi Zhang and Kurt Keutzer and Chenfeng Xu and Yiran Chen},
journal= {arXiv preprint arXiv:2506.02281},
year = {2025}
}