基于 Beta 分布的连续有界动作空间近端策略优化
机器学习
2021-11-04 v1 人工智能
摘要
近年来,用于连续控制任务的强化学习方法不断发展,产生了一系列主要依赖高斯分布来建模随机策略的策略梯度方法。然而,高斯分布具有无限支撑,而现实世界的应用通常具有有界动作空间。这种不一致会导致估计偏差,若改用具有有限支撑的 Beta 分布来建模策略,则可以消除该偏差。在本工作中,我们研究了在 OpenAI Gym 的两个连续控制任务上,使用近端策略优化(PPO)算法训练该 Beta 策略时的表现。在这两个任务中,Beta 策略在智能体的最终期望奖励方面均优于高斯策略,且训练过程表现出更高的稳定性和更快的收敛速度。对于具有高维图像输入的 CarRacing 环境,智能体的成功率比高斯策略提高了 63%。
引用
@article{arxiv.2111.02202,
title = {Proximal Policy Optimization with Continuous Bounded Action Space via the Beta Distribution},
author = {Irving G. B. Petrazzini and Eric A. Antonelo},
journal= {arXiv preprint arXiv:2111.02202},
year = {2021}
}