GRPO 的对齐目标是什么?
机器学习
2025-03-14 v3 人工智能
摘要
在本文中,我们检讨了 Group Policy Optimisation (GRPO) 算法实现的偏好聚合,这是一种用于训练如 DeepSeek-R1-Zero 和 DeepSeekMath 等先进人工智能模型的强化学习方法。GRPO 算法通过奖励偏好模型进行策略训练,该模型通过对给定上下文进行采样,获取一组输出的对应奖励值,并对这些奖励值应用平移-缩放正规化。此外,它还引入了惩罚函数以防止偏离参考策略。我们提出了一种框架,使我们能够 characterize GRPO 算法的定态策略。这一分析表明,偏好聚合与标准的对数概率池化存在根本不同,后者由诸如 RLHF 等其他方法实现。偏好聚合的精确形式源于奖励偏好模型的定义方式以及惩罚函数的作用,我们展示惩罚函数本质上等同于聚合策略与参考策略之间的逆 KL 散度。有趣的是,我们证明对于大小为 two 的群组,奖励偏好模型对应于两两比较偏好,这与其他基于两两比较反馈的对齐方法类似。我们对二进制问题的聚合偏好、大小为 two 的群组以及大群组极限情况下的聚合偏好提供了明确的描述。这提供了关于聚合偏好如何受正则化常数和问题答案置信度边际等参数影响的见解。最后,我们讨论了通过修改 GRPO 算法以使用直接 KL 散度作为惩罚或使用无尺度正规化的奖励所获得的偏好聚合。
引用
@article{arxiv.2502.18548,
title = {What is the Alignment Objective of GRPO?},
author = {Milan Vojnovic and Se-Young Yun},
journal= {arXiv preprint arXiv:2502.18548},
year = {2025}
}