使用单一算法从同策略和异策略数据对大语言模型进行强化学习微调
机器学习
2025-04-01 v2
摘要
我们提出了一种用于微调大语言模型的新型强化学习算法(AGRO,即 Any-Generation Reward Optimization,任意生成奖励优化)。AGRO 利用生成一致性(generation consistency)的概念,该概念指出最优策略满足跨模型任何可能生成的一致性条件。我们推导了通过基于采样的策略梯度找到最优解的算法,并提供了其收敛性的理论保证。我们的实验证明了 AGRO 在同策略和异策略设置中的有效性,表明其在数学推理数据集上相较于基线算法具有更优的性能。
引用
@article{arxiv.2503.19612,
title = {RL-finetuning LLMs from on- and off-policy data with a single algorithm},
author = {Yunhao Tang and Taco Cohen and David W. Zhang and Michal Valko and Rémi Munos},
journal= {arXiv preprint arXiv:2503.19612},
year = {2025}
}