中文

面向大规模推理模型主动 RL 微调的动力学预测抽样

机器学习 2026-03-12 v1 人工智能

摘要

强化学习(RL)微调已成为增强大型语言模型(LLM)推理能力的关键技术之一。然而,其有效性严重依赖于训练数据的选择。近期进展凸显了在线提示选择方法的重要性,这些方法通常在当前策略下聚焦于部分已解决或中等难度的示例,从而产生更有效的模型更新。虽然这些方法在训练步骤上显著加快了 RL 微调速度,但也带来了巨大的计算开销,因为需要对大规模候选批次进行大量 LLM 演绎,以识别具有信息量的样本,这种开销可能超过微调过程本身。为此,本文提出了动力学预测抽样(DPS),通过在高昂的演绎之前推断其学习动力学来在线预测和选择具有信息量的提示。具体而言,我们提出了一种新视角:将 RL 微调期间每个提示的求解进度建模为一个 dynamical system,其中求解程度表示为状态,而转换由隐马尔可夫模型(HMM)特征化。利用历史 rollout 收益信号,我们进行在线贝叶斯推断以估计演化状态分布,推断结果为高效提示选择提供预测性先验,而无需高成本的演绎筛选。跨 diverse reasoning 任务的实验结果表明,DPS 显著减少了冗余演绎,加快了训练进程,并实现了卓越的推理性能。

关键词

引用

@article{arxiv.2603.10887,
  title  = {Dynamics-Predictive Sampling for Active RL Finetuning of Large Reasoning Models},
  author = {Yixiu Mao and Yun Qu and Qi Wang and Heming Zou and Xiangyang Ji},
  journal= {arXiv preprint arXiv:2603.10887},
  year   = {2026}
}

备注

Accepted to ICLR 2026