中文

势场引导的 Actor-Critic 强化学习

机器学习 2020-06-15 v1 人工智能 计算机视觉与模式识别

摘要

本文中,我们考虑 actor-critic 强化学习问题。首先,我们通过引入超越奖励的更多 critic,将 actor-critic 架构扩展为 actor-critic-N 架构。其次,我们将基于奖励的 critic 与基于势场的 critic 结合,提出所提的势场引导的 actor-critic 强化学习方法(actor-critic-2)。这可视为策略改进中基于模型的梯度与无模型梯度的结合。具有大势场的状态通常包含强先验信息,例如远距离指向目标或避开障碍物侧边。在此情形下,我们应更信任基于势场的 critic 作为策略评估以加速策略改进,此时动作策略趋于被引导。例如,在实际应用中,学习避障应被引导而非通过试错学习。具有小势场的状态往往缺乏信息,例如处于局部极小点附近或移动目标周围。此时,我们应更信任基于奖励的 critic 作为策略评估以评估长期回报。在此情况下,动作策略趋于探索。此外,势场评估可与规划结合以估计更好的状态值函数。如此,奖励设计可更关注最终阶段奖励,而非奖励塑形或分阶段奖励。进而,势场评估可弥补多智能体协作问题中通信的不足,即多智能体各自拥有一个基于奖励的 critic 与一个带有先验信息的相对统一的基于势场的 critic。第三,在捕食者-猎物博弈上的简化实验证明了所提方法的有效性。

关键词

引用

@article{arxiv.2006.06923,
  title  = {Potential Field Guided Actor-Critic Reinforcement Learning},
  author = {Weiya Ren},
  journal= {arXiv preprint arXiv:2006.06923},
  year   = {2020}
}

备注

7 pages