中文

DUMP:基于 RL 的 LLM 后训练的自动分布级课程学习

机器学习 2025-10-14 v3 计算与语言

摘要

近期强化学习(RL) 基于的后训练技术在大型语言模型(LLM) 上取得了显著的改进,尤其是增强了其处理复杂任务的推理能力。然而,大多数现有方法将训练数据视为统一整体,忽略了现代 LLM 训练中数据来自不同分布且难度各异的事实。这一异构性引入了一个关键挑战:如何在不同分布之间自适应安排训练以优化学习效率。本文提出一种基于分布级可学习性原理的课程学习框架。我们的核心洞见是,策略优势的大小反映了模型在给定分布上还能从进一步训练中获益的程度。基于此,我们提出了一种用于 RL 基于 LLM 后训练的分布级课程学习框架,利用上置置信界(UCB)原则动态调整不同分布的抽样概率。该方法优先选择具有高平均优势(利用)或低样本计数(探索)的分布,从而实现自适应且理论上有据可循的训练计划。我们以 GRPO 作为底层 RL 算法实例化我们的课程学习框架,并在多个难度和来源的逻辑推理数据集上演示其有效性。我们的实验显示,该框架显著提高了收敛速度和最终性能,凸显了 LLM 后训练中分布感知课程策略的价值。代码:https://github.com/ZhentingWang/DUMP。

关键词

引用

@article{arxiv.2504.09710,
  title  = {DUMP: Automated Distribution-Level Curriculum Learning for RL-based LLM Post-training},
  author = {Zhenting Wang and Guofeng Cui and Yu-Jhe Li and Kun Wan and Wentian Zhao},
  journal= {arXiv preprint arXiv:2504.09710},
  year   = {2025}
}