中文

基于深度强化学习的 $(1+(\lambda,\lambda))$ -GA 在 OneMax 上的多参数控制

机器学习 2025-07-22 v3 神经与进化计算

摘要

众所周知,进化算法可以通过动态选择关键参数来获益,以调整其搜索策略以适应优化过程中不同阶段的需求。一个在 OneMax 函数上运行的 (1+(λ,λ))(1+(\lambda,\lambda)) 遗传算法 (GA) 的动态参数选择已被证明可实现超常数的速度提升。虽然最优参数控制策略可实现线性预期运行时间,但静态参数选择无法实现。此结果催生了大量对参数控制策略的研究。然而,许多研究,特别是理论运行时间分析,专注于控制单个参数。对于控制多个参数的策略推导仍极具挑战性。本文重新审视了 (1+(λ,λ))(1+(\lambda,\lambda)) 遗传算法优化 OneMax 的问题。我们将其四个主要参数解耦,探讨基于 state-of-the-art 深度强化学习技术如何近似优秀控制策略。我们表明,尽管深度强化学习学习效果具有挑战性,但一旦有效,其将非常强大,能够发现超越所有先前在同一基准上已知控制策略的政策。基于通过强化学习发现的结果,我们推导出一种简单控制策略,对于所有测试的规模(最高达 40,00040,000),均超过默认理论推荐设置提高 27%27\%,并超过 irace 调优策略——该策略是该基准上最强现有控制策略——提高 13%13\%

关键词

引用

@article{arxiv.2505.12982,
  title  = {Multi-parameter Control for the $(1+(\lambda,\lambda))$-GA on OneMax via Deep Reinforcement Learning},
  author = {Tai Nguyen and Phong Le and Carola Doerr and Nguyen Dang},
  journal= {arXiv preprint arXiv:2505.12982},
  year   = {2025}
}