离策略训练与函数逼近下收敛的 Actor-Critic 算法
人工智能
2018-02-23 v1
摘要
我们提出了第一类策略梯度算法,其同时支持状态值函数与策略函数逼近,并保证在离策略训练下收敛。我们的解决方案针对强化学习中存在动作表示加剧维度灾难的问题,即具有连续或大规模动作集合,从而难以估计状态-动作值函数(Q 函数)的情形。使用状态值函数有助于消除维度灾难,并由此自然地将我们的策略梯度方案转化为经典的 Actor-Critic 架构,其中 Actor 利用状态值函数进行更新。我们的算法——梯度 Actor-Critic 与强调型 Actor-Critic——基于平均状态值函数目标的精确梯度推导,因此保证收敛至其最优解,同时保持经典 Actor-Critic 方法的所有理想性质且无需额外超参数。据我们所知,这是首次将收敛的离策略学习方法扩展至带函数逼近的经典 Actor-Critic 方法。
引用
@article{arxiv.1802.07842,
title = {Convergent Actor-Critic Algorithms Under Off-Policy Training and Function Approximation},
author = {Hamid Reza Maei},
journal= {arXiv preprint arXiv:1802.07842},
year = {2018}
}