基于策略的优化:视作进化策略的单步策略梯度方法
最优化与控制
2021-11-29 v3
摘要
本研究报道了一种基于单步深度强化学习(DRL)的黑盒优化方法的最新进展,及其在概念上与进化策略(ES)技术的相近性。仿照策略梯度(PG)方法,基于策略的优化(PBO)算法依赖于策略网络的更新以描述其下一代个体的密度函数。本文详述该方法,并指出其与 ES 和 PG 方法的相似之处。随后在标准解析函数最小化上评估该方法的相关性,并与经典 ES 技术(ES、CMA-ES)比较。接着将其应用于为 Lorenz 吸引子设计的参数化控制律的优化。鉴于关于该方法的现有文献稀少,本工作确证 PBO 方法为一种有效、通用的黑盒优化技术,并为神经网络方法灵活性所允许多种未来改进开辟了道路。
引用
@article{arxiv.2104.06175,
title = {Policy-based optimization: single-step policy gradient method seen as an evolution strategy},
author = {Jonathan Viquerat and Régis Duvigneau and Philippe Meliga and Alexander Kuhnle and Elie Hachem},
journal= {arXiv preprint arXiv:2104.06175},
year = {2021}
}