正则化 Actor-Critic 方法的一个收敛结果
机器学习
2019-10-23 v2 机器学习
摘要
在本文中,我们在适当条件下,利用随机逼近的工具,给出了某一类 actor-critic 算法以概率一收敛去寻找熵正则化 MDP 近似解的证明。为得到这一整体结果,我们证明了在使用线性逼近架构时带一般正则化项的策略评估的收敛性,并展示了熵正则化策略改进的收敛性。
引用
@article{arxiv.1907.06138,
title = {A Convergence Result for Regularized Actor-Critic Methods},
author = {Wesley Suttle and Zhuoran Yang and Kaiqing Zhang and Ji Liu},
journal= {arXiv preprint arXiv:1907.06138},
year = {2019}
}