论在 LLM 推理训练时设计有效 RL 奖励函数
机器学习
2024-11-28 v3 人工智能
计算与语言
摘要
奖励模型在提高 LLM 推理能力方面日益重要。已有研究表明,经过良好训练的奖励模型可通过搜索在推理时显著提升模型性能。然而,奖励模型在 RL 训练时的潜力仍 largely 未被探索。目前尚不清楚这些奖励模型是否能提供额外的训练信号来增强 LLM 在稀疏成功奖励(用于验证解答正确性)的 RL 训练中的推理能力。在本文中,我们评估了流行的用于 RL 训练的奖励模型,包括结果监督奖励模型(ORM)和过程监督奖励模型(PRM),并通过将这些所学奖励与成功奖励结合使用,对一系列用于解数学问题的 LLM 进行 RL 训练。令人惊讶的是,尽管这些所学奖励模型在推理时表现出色,但它们可能对 RL 训练没有帮助,甚至会导致性能下降,比仅使用成功奖励训练的 LLM 表现更差。我们的分析揭示,LLM 可通过重复正确但不必要的推理步骤获得高额奖励,从而导致严重的奖励作弊问题。因此,我们引入两种新的奖励细化技术,包括裁剪(Clipping)和增量(Delta)。其核心思想是确保任何推理轨迹的累积奖励受上限约束,以保持所学奖励模型的有效性而不被滥用。我们在多个奖励模型上对 1.5B 和 7B 参数的 LLM 在 MATH 和 GSM8K 数据集上进行评估,证明在仔细设计的奖励函数下,无需任何额外的监督调优即可提升所评估的所有 LLM,包括在 MATH 和 GSM8K 数据集上表现突出的 SOTA 7B LLM Qwen2.5-Math-7B-Instruct。
引用
@article{arxiv.2410.15115,
title = {On Designing Effective RL Reward at Training Time for LLM Reasoning},
author = {Jiaxuan Gao and Shusheng Xu and Wenjie Ye and Weilin Liu and Chuyi He and Wei Fu and Zhiyu Mei and Guangju Wang and Yi Wu},
journal= {arXiv preprint arXiv:2410.15115},
year = {2024}
}