中文

面向离线强化学习的网格映射伪计数约束

机器学习 2024-11-08 v2 人工智能

摘要

离线强化学习通过静态数据集学习,无需与环境交互,这保证了安全性,因此具有良好的应用前景。然而,直接应用朴素的强化学习算法在离线环境中通常会失败,由于由于离分布(OOD)状态-动作导致的Q值估计不准确。对抗惩罚OD状态-动作的Q值是解决这一问题的有效方法。在惩罚OD状态-动作的方法中,基于计数的方法在离散域中以简单形式取得良好成果。受其启发,我们提出一种称为网格映射伪计数方法(GPC)的新型伪计数方法,用于连续域,通过将计数方法从离散扩展到连续域。首先,将连续状态和动作空间映射到离散空间,然后通过伪计数约束OD状态-动作的Q值。其次,给出理论证明,表明GPC在较少假设下即可获得适当的不确定性约束。最后,我们将GPC与Soft Actor-Critic算法(SAC)组合得到新算法GPC-SAC。最后,在D4RL数据集上进行实验,表明GPC-SAC在其他约束Q值的算法中表现更好且计算成本更低。

关键词

引用

@article{arxiv.2404.02545,
  title  = {Grid-Mapping Pseudo-Count Constraint for Offline Reinforcement Learning},
  author = {Yi Shen and Hanyan Huang},
  journal= {arXiv preprint arXiv:2404.02545},
  year   = {2024}
}