中文

软分解策略-评论家:以离散强化学习弥合有效连续控制的鸿沟

机器学习 2023-08-22 v1 人工智能

摘要

离散强化学习(RL)算法在求解具有离散动作空间的序列决策任务(如 Atari 游戏)中展现了卓越性能。然而,由于维度爆炸的挑战,当其应用于连续控制问题时效果受限。本文提出软分解策略-评论家(SDPC)架构,将软 RL 与 actor-critic 技术与离散 RL 方法相结合以克服该局限。SDPC 独立离散化每个动作维度,并采用共享评论家网络以最大化软 QQ 函数。这一新颖方法使 SDPC 能够支持两类策略:产生软分解 Actor-Critic(SDAC)算法的分解 actors,以及生成 Boltzmann 软探索策略、从而得到软分解-评论家 Q(SDCQ)算法的分解 QQ 网络。通过大量实验,我们证明所提方法在包括 Mujoco 的 Humanoid 与 Box2d 的 BipedalWalker 在内的多种连续控制任务中优于最先进的连续 RL 算法。这些实证结果验证了 SDPC 架构在应对连续控制相关挑战中的有效性。

关键词

引用

@article{arxiv.2308.10203,
  title  = {Soft Decomposed Policy-Critic: Bridging the Gap for Effective Continuous Control with Discrete RL},
  author = {Yechen Zhang and Jian Sun and Gang Wang and Zhuo Li and Wei Chen},
  journal= {arXiv preprint arXiv:2308.10203},
  year   = {2023}
}