中文

内化 LLM 强化微调中的课程判断

机器学习 2026-05-13 v1 人工智能

摘要

在 LLM 强化微调(RFT)中,课程学习驱动效率和性能。然而,当前方法通过手工启发式或辅助模型将课程判断外部化,存在与策略训练动力学不一致的风险。本文引入 METIS(METacognitive Internalized Self-judgment),一个内化课程判断为原生能力的新框架。我们利用一种关键观察:在提示词中的奖励方差有效衡量了提示词的信息量,METIS 基于最近的训练结果作为轻量级情境学习示例来预测此指标。这种内在的自我判断然后动态决定训练分配。此外,METIS 通过联合优化标准 RFT 奖励和自我判断奖励来关闭判断与优化之间的循环。这使策略能够学习下一步学习什么,一种元认知形式。在广泛的离散和连续 RFT 基准测试中,涵盖数学推理、代码生成和智能体功能调用,METIS 持续提供优异的性能,同时通过最高可达 67% 的加速收敛。通过规避手工启发式和辅助模型,我们的工作建立了一个简单、封闭环且高度高效的课程内化范式用于 LLM 强化微调。

关键词

引用

@article{arxiv.2605.11235,
  title  = {Internalizing Curriculum Judgment for LLM Reinforcement Fine-Tuning},
  author = {Han Zheng and Yining Ma and Karthick Gunasekaran and Bharathan Balaji and Zheng Du and Shiv Vitaladevuni and Cathy Wu},
  journal= {arXiv preprint arXiv:2605.11235},
  year   = {2026}
}