中文

通过进化代理辅助决策实现高效强化学习

神经与进化计算 2020-04-23 v2 机器学习

摘要

如今,组织中关于决策的历史数据已大量可用,这些数据包含决策问题、所做的决策以及结果的可取程度。利用这些数据,可以学习一个代理模型,并借助该模型进化出一种优化结果的决策策略。本文提出一种通用的此类方法,称为进化代理辅助决策(Evolutionary Surrogate-Assisted Prescription,ESP)。该代理模型例如是用梯度下降训练的随机森林或神经网络,而策略则是一个为最大化代理模型预测值而进化的神经网络。本文进一步将 ESP 扩展至序列决策任务,从而能够在强化学习(RL)基准上评估该框架。由于大多数评估在代理模型上完成,ESP 比标准 RL 方法具有更高的样本效率、更低的方差和更低的遗憾值。令人惊讶的是,其解也更优,因为代理模型和策略网络均对决策行为起到了正则化作用。因此,ESP 构成了现实世界问题中决策优化大有前景的基础。

关键词

引用

@article{arxiv.2002.05368,
  title  = {Effective Reinforcement Learning through Evolutionary Surrogate-Assisted Prescription},
  author = {Olivier Francon and Santiago Gonzalez and Babak Hodjat and Elliot Meyerson and Risto Miikkulainen and Xin Qiu and Hormoz Shahrzad},
  journal= {arXiv preprint arXiv:2002.05368},
  year   = {2020}
}