通过在LLM训练后进行逻辑平均来将强化学习与SFT结合
机器学习
2026-05-21 v1 人工智能
摘要
我们介绍了一种新方法,通过对冻结的参考策略(例如SFT)和可训练策略的逻辑进行平均,并将该方法纳入Group Relative Policy Optimization (GRPO)。与包含可验证奖励的强化学习 (RLVR) 方法不同,我们的方案不涉及KL正则化或批评家;通过逻辑平均结构将可训练策略与参考锚点耦合,以利用可训练策略的推理专业知识,同时保持SFT的格式优势。该方法在MATH、cn-k12和MMLU上进行评估,结果表明相对于标准KL正则化GRPO,本方法在准确率上更高或至少与之相当。
引用
@article{arxiv.2605.20555,
title = {Complementing reinforcement learning with SFT through logit averaging in the post training of LLMs},
author = {Xingwei Gan and Ying Zhu},
journal= {arXiv preprint arXiv:2605.20555},
year = {2026}
}