中文

基于不确定性引导的强化学习微调大型语言模型的检查点选择

机器学习 2025-11-14 v1

摘要

强化学习(RL)微调是对大型语言模型(LLM)进行对齐的关键方法,但该过程异常不可靠且在不同模型检查点之间表现出高方差。在实际应用中,选择最佳检查点具有挑战性:在训练期间在验证集上评估检查点计算成本高昂且需要良好的验证集,而依赖最终检查点则无法保证良好的性能。我们提出了一种基于不确定性引导的检查点选择(UGCS)方法,规避了上述困境。该方法利用每个样本的不确定性识别难题问答对,并通过它们处理这些困难案例的能力对检查点进行排序。通过对短训练窗口内前不确定样本的奖励进行平均,我们的方法在无需额外前向传递或显著计算开销的情况下产生稳定且具辨识力的信号。实验在三个数据集和三个 LLM 上表明,该方法始终能够识别出更具泛化能力的检查点,优于依赖训练或验证性能的传统策略。这些结果突显了解决其最难任务时具有低不确定性的模型是最可靠的整体模型。

关键词

引用

@article{arxiv.2511.09864,
  title  = {Uncertainty-Guided Checkpoint Selection for Reinforcement Finetuning of Large Language Models},
  author = {Manh Nguyen and Dung Nguyen and Dai Do and Svetha Venkatesh and Hung Le},
  journal= {arXiv preprint arXiv:2511.09864},
  year   = {2025}
}