好与坏与混合:推理模型训练中的奖励结构对比
机器学习
2025-11-18 v1
摘要
奖励设计是强化学习从人类反馈(RLHF)和对齐研究中的核心问题。本文提出了一个统一框架,用于研究在数学推理任务上对大语言模型(LLM)进行微调时,硬性奖励、连续奖励和混合奖励结构的研究。我们使用 Qwen3-4B 模型在 GSM8K 数据集上进行 LoRA 微调,形式化并经验评估了包含正确性、困惑度、推理质量和一致性的奖励函数。我们引入了一个自适应混合奖励调度器,在离散信号和连续信号之间进行转换,平衡探索与稳定性。我们的结果表明,混合奖励结构在纯粹的硬性或连续方法上具有更快的收敛速度和更好的训练稳定性,为通过自适应奖励建模实现对齐提供了洞见。
引用
@article{arxiv.2511.13016,
title = {The Good, The Bad, and The Hybrid: A Reward Structure Showdown in Reasoning Models Training},
author = {Subramanyam Sahoo},
journal= {arXiv preprint arXiv:2511.13016},
year = {2025}
}
备注
Paper accepted to the 2nd Workshop on Aligning Reinforcement Learning Experimentalists and Theorists (ARLET 2025) at NeurIPS; the paper consists of 14 pages (including the appendix) and contains 3 figures