匹配精度,不同几何:进化策略 vs GRPO 在 LLM 后训练中的比较
机器学习
2026-04-03 v1
摘要
进化策略 (ES) 已成为基于强化学习的 LLM 微调的可扩展无梯度替代方案,但是否意味着相同任务性能蕴含相同参数空间中的相同解仍不明确。我们在四个任务的单任务和顺序持续学习设置中比较 ES 和 Group Relative Policy Optimization (GRPO)。ES 在单任务精度上匹配或超过 GRPO,在受控迭代预算的情况下在顺序学习中仍保持竞争力。尽管两者在任务性能上相似,两种方法产生的模型更新呈现明显不同的几何特征:ES 进行更大幅度的变更,引起更广泛的 off-task KL drift,而 GRPO 进行较小、更局部化的更新。令人惊讶的是,ES 和 GRPO 的解在几何上是线性可连接的,尽管其更新方向几乎正交。我们发展了一套解释 ES 的分析理论,说明所有这些现象都在一个统一的框架中得到解释,表明 ES 如何在弱信息方向上积累大量 off-task 移动,同时仍能在下游精度上与基于梯度的 RL 相匹配。这些结果表明,梯度-free 和梯度-based 微调可以到达同样精确但几何上不同的解,对于遗忘和知识保存具有重要影响。源代码公开可用:https://github.com/Bhoy1/ESvsGRPO。
引用
@article{arxiv.2604.01499,
title = {Matching Accuracy, Different Geometry: Evolution Strategies vs GRPO in LLM Post-Training},
author = {William Hoy and Binxu Wang and Xu Pan},
journal= {arXiv preprint arXiv:2604.01499},
year = {2026}
}