面向连续状态与动作 MDP 的随机策略学习
机器学习
2020-11-17 v2 人工智能
机器学习
摘要
深度强化学习方法在从视频游戏到运动控制等一系列具有挑战性的高维领域中取得了最先进的成果。成功的关键在于使用深度神经网络来近似策略和价值函数。然而,要获得良好结果需要对权重进行大量调优。我们转而使用随机函数近似。此类网络不仅比训练全连接网络更廉价,而且能提升数值性能。我们提出 \texttt{RANDPOL},一种用于连续状态与动作空间 MDP 的广义策略迭代算法。策略和价值函数均由随机网络表示。我们还给出了该算法性能的有限时间保证。随后我们展示了在具有挑战性的环境中的数值表现,并与基于深度神经网络的算法进行了比较。
引用
@article{arxiv.2006.04331,
title = {Randomized Policy Learning for Continuous State and Action MDPs},
author = {Hiteshi Sharma and Rahul Jain},
journal= {arXiv preprint arXiv:2006.04331},
year = {2020}
}