中文

基于动作平衡探索未知状态

人工智能 2020-09-02 v2 机器学习

摘要

探索是强化学习中的关键问题。近来基于奖励的方法在蒙特祖玛的复仇等探索困难的环境中取得了可观成功,其通过赋予额外奖励(如内在奖励)来引导智能体前往极少访问的状态。由于奖励根据执行动作后下一状态的新颖度计算,我们称此类方法为下一状态奖励方法。然而,下一状态奖励方法迫使智能体过度关注探索已知状态,而忽略寻找未知状态,因为探索由已访问的下一状态驱动,这可能在某些环境中放慢寻找奖励的节奏。本文聚焦于提升寻找未知状态的有效性,提出动作平衡探索,其在给定状态下平衡各动作的选择频率,可视为上置信界(UCB)在深度强化学习中的扩展。此外,我们提出动作平衡 RND,结合下一状态奖励方法(如随机网络蒸馏探索,RND)与我们的动作平衡探索以兼顾双方优势。在网格世界与 Atari 游戏上的实验分别表明,动作平衡探索具有更好的寻找未知状态能力,并能提升 RND 在某些困难探索环境中的表现。

关键词

引用

@article{arxiv.2003.04518,
  title  = {Exploring Unknown States with Action Balance},
  author = {Yan Song and Yingfeng Chen and Yujing Hu and Changjie Fan},
  journal= {arXiv preprint arXiv:2003.04518},
  year   = {2020}
}