强化学习微调用于指令遵循与数学推理的语言模型
计算与语言
2025-07-29 v2 人工智能
摘要
本研究探讨了基于强化学习 (RL) 微调技术,对小型语言模型 (Qwen2.5-0.5B Base) 在两个具有挑战性的任务上的有效性,即指令遵循与数学推理。我们比较了监督微调 (SFT)、使用偏好标注数据进行直接偏好优化 (DPO) 以及基于奖励模型的强化学习留后验 (RLOO)。我们的实验表明,采用 DeBERTa 奖励建模的 RLOO 在对齐方面效果最佳,而 DPO 提供了稳健且一致的效果。对于数学推理任务,合成数据增强和使用外部验证器进行最佳-N采样显著提高了准确率,显示出结合微调与推理时工具的潜力。本研究突出了训练轻量级、任务对齐小规模语言模型中的关键权衡和实用策略。
引用
@article{arxiv.2506.21560,
title = {Reinforcement learning fine-tuning of language model for instruction following and math reasoning},
author = {Yifu Han and Geo Zhang},
journal= {arXiv preprint arXiv:2506.21560},
year = {2025}
}