中文

利用单峰概率分布离散化连续动作空间以进行策略型强化学习

机器学习 2024-08-02 v1 人工智能

摘要

对于策略型强化学习,连续控制的动作空间离散化可以方便地表达多种模式,并且易于优化。然而,如果不考虑离散原子动作之间的固有顺序,离散动作数量的爆炸式增长可能导致不良性质,并诱发策略梯度估计器更高的方差。在本文中,我们提出了一种简单的架构,通过使用泊松概率分布约束离散策略为单峰来解决此问题。这种单峰架构可以利用显式的单峰概率分布更好地利用底层连续动作空间中的连续性。我们进行了大量实验,结果表明具有单峰概率分布的离散策略在具有挑战性的控制任务中——尤其是在人形机器人等高度复杂任务中——为策略型强化学习算法提供了显著更快的收敛速度和更高的性能。我们对策略梯度估计器的方差进行了理论分析,结果表明我们精心设计的单峰离散策略可以保持较低的方差并产生稳定的学习过程。

关键词

引用

@article{arxiv.2408.00309,
  title  = {Discretizing Continuous Action Space with Unimodal Probability Distributions for On-Policy Reinforcement Learning},
  author = {Yuanyang Zhu and Zhi Wang and Yuanheng Zhu and Chunlin Chen and Dongbin Zhao},
  journal= {arXiv preprint arXiv:2408.00309},
  year   = {2024}
}

备注

IEEE Transactions on Neural Networks and Learning Systems