中文

NADPEx:一种用于深度强化学习的在策略时间一致性探索方法

机器学习 2018-12-27 v2 机器人学 机器学习

摘要

强化学习智能体需要探索行为以逃离局部最优。这些行为可能包括即时的抖动扰动和时间一致性探索。为了实现这些,一个在一段时间内固有一致的随机策略模型是所需的,特别是对于具有稀疏奖励或长期信息的任务。在这项工作中,我们为深度强化学习智能体引入了一种新颖的在策略时间一致性探索策略——神经自适应丢弃策略探索(NADPEx)。丢弃被建模为条件分布的全局随机变量,被纳入强化学习策略中,使其具有固有的时间一致性,即使在奖励信号稀疏时也是如此。我们讨论了两个因素,即目标梯度对齐和策略空间中的KL约束,以保证NADPEx策略的稳定改进。我们的实验表明,NADPEx解决了具有稀疏奖励的任务,而朴素探索和参数噪声则失败。它在标准的mujoco连续控制基准中也产生相当甚至更快的收敛。

关键词

引用

@article{arxiv.1812.09028,
  title  = {NADPEx: An on-policy temporally consistent exploration method for deep reinforcement learning},
  author = {Sirui Xie and Junning Huang and Lanxin Lei and Chunxiao Liu and Zheng Ma and Wei Zhang and Liang Lin},
  journal= {arXiv preprint arXiv:1812.09028},
  year   = {2018}
}

备注

To appear in ICLR 2019