通过策略梯度从优化经验中学习自适应差分进化算法
神经与进化计算
2021-02-09 v1
摘要
差分进化是基于种群的求解黑盒问题的最负盛名的随机优化算法之一。差分进化算法的性能高度依赖于其变异与交叉策略以及相关的控制参数。然而,确定最合适参数设置的过程麻烦且耗时。能够适应问题地形和优化环境的自适应控制参数方法比固定参数设置更可取。本文提出一种基于从一组问题的优化经验中学习的新型自适应参数控制方法。在该方法中,参数控制被建模为有限 horizon 马尔可夫决策过程。一种称为策略梯度的强化学习算法被用于学习一个智能体(即参数控制器),该智能体能在搜索过程中自适应地提供所提出差分进化的控制参数。基于所学智能体的差分进化算法在CEC'13和CEC'17测试集上与九种著名进化算法进行比较。实验结果表明,所提算法在测试集上相较于这些对比算法具有竞争力。
引用
@article{arxiv.2102.03572,
title = {Learning adaptive differential evolution algorithm from optimization experiences by policy gradient},
author = {Jianyong Sun and Xin Liu and Thomas Bäck and Zongben Xu},
journal= {arXiv preprint arXiv:2102.03572},
year = {2021}
}