中文

(1+1)进化算法变异概率最优控制的强化学习视角:OneMax问题的初步结果

神经与进化计算 2019-05-10 v1 人工智能

摘要

我们研究如何运用强化学习对进化算法中的参数进行最优控制。我们在OneMax函数上控制(1+1)进化算法的变异概率。该问题被建模为马尔可夫决策过程,并通过已知的转移概率用值迭代求解。随后通过Q-Learning(一种无需精确转移概率的强化学习算法)求解。该方法也允许将先前的专家或经验知识纳入学习。它为优化中的参数控制问题开辟了形式与计算上的新视角。

关键词

引用

@article{arxiv.1905.03726,
  title  = {A Reinforcement Learning Perspective on the Optimal Control of Mutation Probabilities for the (1+1) Evolutionary Algorithm: First Results on the OneMax Problem},
  author = {Luca Mossina and Emmanuel Rachelson and Daniel Delahaye},
  journal= {arXiv preprint arXiv:1905.03726},
  year   = {2019}
}