中文

GRPOformer:基于群相对策略优化(GRPO)的超参数优化方法

机器学习 2025-09-23 v1

摘要

超参数优化(HPO)在提高模型性能方面发挥着关键作用。基于Transformer的HPO方法显示出巨大的潜力;然而,现有方法依赖大规模的历史优化轨迹,且缺乏有效的强化学习(RL)技术,从而限制了其效率和性能提升。灵感来源于群相对策略优化(GRPO)在大语言模型(LLM)中的成功,我们提出了GRPOformer——一种集成强化学习(RL)与Transformer的新型超参数优化框架。在GRPOformer中,采用Transformer从历史优化轨迹中生成新的超参数配置,而GRPO则实现从零开始的快速轨迹构建和优化策略学习。此外,我们引入了策略离子正则化(PCR)来增强GRPO训练的稳定性。在OpenML上的实验结果表明,GRPOformer在 diverse tasks 上 consistently优于基线方法,为RL在HPO中的应用提供了新视角。

关键词

引用

@article{arxiv.2509.17105,
  title  = {GRPOformer: Advancing Hyperparameter Optimization via Group Relative Policy Optimization},
  author = {Haoxin Guo and Jiawen Pan and Weixin Zhai},
  journal= {arXiv preprint arXiv:2509.17105},
  year   = {2025}
}