内化 LLM 强化微调中的课程判断
机器学习
2026-05-13 v1 人工智能
摘要
在 LLM 强化微调(RFT)中,课程学习驱动效率和性能。然而,当前方法通过手工启发式或辅助模型将课程判断外部化,存在与策略训练动力学不一致的风险。本文引入 METIS(METacognitive Internalized Self-judgment),一个内化课程判断为原生能力的新框架。我们利用一种关键观察:在提示词中的奖励方差有效衡量了提示词的信息量,METIS 基于最近的训练结果作为轻量级情境学习示例来预测此指标。这种内在的自我判断然后动态决定训练分配。此外,METIS 通过联合优化标准 RFT 奖励和自我判断奖励来关闭判断与优化之间的循环。这使策略能够学习下一步学习什么,一种元认知形式。在广泛的离散和连续 RFT 基准测试中,涵盖数学推理、代码生成和智能体功能调用,METIS 持续提供优异的性能,同时通过最高可达 67% 的加速收敛。通过规避手工启发式和辅助模型,我们的工作建立了一个简单、封闭环且高度高效的课程内化范式用于 LLM 强化微调。
引用
@article{arxiv.2605.11235,
title = {Internalizing Curriculum Judgment for LLM Reinforcement Fine-Tuning},
author = {Han Zheng and Yining Ma and Karthick Gunasekaran and Bharathan Balaji and Zheng Du and Shiv Vitaladevuni and Cathy Wu},
journal= {arXiv preprint arXiv:2605.11235},
year = {2026}
}