ESSAM:一种面向内存高效 LLMs 微调的新型竞争性进化策略方法
机器学习
2026-05-11 v2 人工智能
摘要
强化学习(RL)已成为提高大型语言模型(LLMs)数学推理能力的关键训练步骤,但通常具有高 GPU 内存占用,在资源有限的环境中难以使用。为减少这些问题,本文提出了Evolution Strategies with Sharpness-Aware Maximization(ESSAM),一种紧密结合 Evolution Strategies(ES)在参数空间中的零阶搜索与 Sharpness-Aware Maximization(SAM)以提高泛化能力的完整参数微调框架。我们在主流的数学推理任务 GSM8K 上进行微调实验。结果表明,ESSAM 在所有模型上的平均准确率达到78.27%,其整体性能与 RL 方法相当,以77.72%的准确率超越经典 RL 算法 PPO,以78.34%的准确率与 GRPO 持平,甚至在某些模型上取得领先。进一步的泛化实验表明,使用 ESSAM 训练的模型表现出更强的泛化能力。其平均性能在5个6个数据集中实现最佳结果,表明 ESSAM 可以有效提高微调模型的泛化性能。就 GPU 内存使用而言,ESSAM 比 PPO 减少约18倍的 GPU 内存使用,比 GRPO 减少约10倍,实现了极低的 GPU 内存占用。此外,我们设计了 ESSAM 的一个加速变体,实现了近乎二分之二的加速速度,同时保持与 ESSAM 相同的 GPU 内存使用,平均准确率达到78.02%,超越 PPO。代码:https://github.com/szs777/ESSAM
引用
@article{arxiv.2602.01003,
title = {ESSAM: A Novel Competitive Evolution Strategies Approach to Reinforcement Learning for Memory Efficient LLMs Fine-Tuning},
author = {Zhishen Sun and Sizhe Dang and Guang Dai and Haishan Ye},
journal= {arXiv preprint arXiv:2602.01003},
year = {2026}
}