(1+1)进化算法变异概率最优控制的强化学习视角:OneMax问题的初步结果
神经与进化计算
2019-05-10 v1 人工智能
摘要
我们研究如何运用强化学习对进化算法中的参数进行最优控制。我们在OneMax函数上控制(1+1)进化算法的变异概率。该问题被建模为马尔可夫决策过程,并通过已知的转移概率用值迭代求解。随后通过Q-Learning(一种无需精确转移概率的强化学习算法)求解。该方法也允许将先前的专家或经验知识纳入学习。它为优化中的参数控制问题开辟了形式与计算上的新视角。
引用
@article{arxiv.1905.03726,
title = {A Reinforcement Learning Perspective on the Optimal Control of Mutation Probabilities for the (1+1) Evolutionary Algorithm: First Results on the OneMax Problem},
author = {Luca Mossina and Emmanuel Rachelson and Daniel Delahaye},
journal= {arXiv preprint arXiv:1905.03726},
year = {2019}
}