中文

通过哈密顿蒙特卡洛方法改进演员-评论家强化学习

机器学习 2022-01-04 v3 机器学习

摘要

演员-评论家强化学习(actor-critic RL)被广泛应用于各类机器人控制任务中。从变分推断(VI)的视角看待演员-评论家 RL,策略网络被训练以获得给定最优性准则下动作的近似后验。然而在实践中,由于摊销差距与探索不足,演员-评论家 RL 可能产生次优策略估计。受先前哈密顿蒙特卡洛(HMC)在 VI 中应用的启发,本文提出将演员-评论家 RL 的策略网络与 HMC 相整合,称之为{\it 哈密顿策略}(Hamiltonian Policy)。据此我们提出依据 HMC 从基策略演化动作,所提方法具有诸多益处。首先,HMC 可改进策略分布以更好地近似后验,从而减小摊销差距。其次,HMC 还能将探索更多地引导至具有更高 Q 值的动作空间区域,提升探索效率。此外,不同于直接将 HMC 应用于 RL,我们提出一种新的蛙跳算子来模拟哈密顿动力学。最后,在安全 RL 问题中,我们发现所提方法不仅能提高所获回报,还能通过丢弃潜在不安全动作来减少安全约束违反。通过在包括 MuJoCo 与 PyBullet Roboschool 的连续控制基准上的综合实证实验,我们表明该方法相较先前演员-评论家方法是一种数据高效且易于实现的改进。

关键词

引用

@article{arxiv.2103.12020,
  title  = {Improving Actor-Critic Reinforcement Learning via Hamiltonian Monte Carlo Method},
  author = {Duo Xu and Faramarz Fekri},
  journal= {arXiv preprint arXiv:2103.12020},
  year   = {2022}
}