中文

通过偏好引导的随机探索实现采样高效的深度强化学习

机器学习 2022-06-22 v1 人工智能 机器人学

摘要

深度Q网络(DQN)算法所解决的大量实际工作表明,尽管随机策略简单,但它是最常用的探索方法。然而,大多数现有的随机探索方法要么不考虑Q值而启发式地探索新动作,要么不可避免地在学习过程中引入偏差,将采样与Q值耦合。在本文中,我们提出了一种新颖的偏好引导的ϵ\epsilon-greedy探索算法,该算法能够在不引入额外偏差的情况下,为DQN有效地学习符合Q值分布的动作分布。具体来说,我们设计了一个由两个分支组成的双重架构,其中一个分支是DQN的副本,即Q分支。另一个分支,我们称之为偏好分支,学习DQN隐式遵循的动作偏好。我们从理论上证明了策略改进定理对偏好引导的ϵ\epsilon-greedy策略成立,并通过实验表明,推断出的动作偏好分布与相应Q值的分布一致。因此,偏好引导的ϵ\epsilon-greedy探索促使DQN智能体采取多样化的动作,即具有较大Q值的动作可以被更频繁地采样,而具有较小Q值的动作仍然有机会被探索,从而鼓励探索。我们在九个不同的环境中用四种著名的DQN变体评估了所提出的方法。广泛的结果证实了我们提出的方法在性能和收敛速度方面的优越性。索引词——偏好引导探索,随机策略,数据效率,深度强化学习,深度Q学习。

关键词

引用

@article{arxiv.2206.09627,
  title  = {Sampling Efficient Deep Reinforcement Learning through Preference-Guided Stochastic Exploration},
  author = {Wenhui Huang and Cong Zhang and Jingda Wu and Xiangkun He and Jie Zhang and Chen Lv},
  journal= {arXiv preprint arXiv:2206.09627},
  year   = {2022}
}