理解用于模型训练的强化学习及基于 GRAPE 的未来方向
计算与语言
2025-10-22 v2 人工智能
机器学习
摘要
本文提供了一个自包含、从零开始的论述,介绍模型指令微调的关键算法:SFT、Rejection Sampling、REINFORCE、Trust Region Policy Optimization (TRPO)、Proximal Policy Optimization (PPO)、Group Relative Policy Optimization (GRPO) 和 Direct Preference Optimization (DPO)。对这些算法的解释通常假设读者具备先验知识、缺乏关键细节,且/或过于泛化和复杂。在此,我们使用简明且明确的符号,以 LLM 为核心逐步讨论并推导每种方法,旨在消除歧义并提供清晰直观的概念理解。通过尽量减少对更广泛 RL 文献的迂回探讨并将概念与 LLM 相联系,我们消除了多余的抽象并降低了认知开销。在此论述之后,我们对上述详述内容之外的新技术与方法进行了文献综述。最后,我们以 GRAPE (Generalized Relative Advantage Policy Evolution) 的形式提出了新的研究与探索思路。
引用
@article{arxiv.2509.04501,
title = {Understanding Reinforcement Learning for Model Training, and future directions with GRAPE},
author = {Rohit Patel},
journal= {arXiv preprint arXiv:2509.04501},
year = {2025}
}
备注
35 pages, 1 figure