中文

一种无熵正则化机制的基于策略的强化学习方法

机器学习 2021-06-03 v1 人工智能

摘要

基于策略的强化学习方法存在策略崩溃问题。我们发现带有{\epsilon}-greedy机制的基于价值(value-based)的强化学习方法能够享有三个特性:闭式多样性、目标不变探索与自适应权衡,这些特性帮助基于价值的方法避免策略崩溃问题。然而,对于基于策略的方法并不存在一种实现全部三个特性的并行机制。在本文中,我们提出一种为基于策略的方法设计的无熵正则化机制,其实现了闭式多样性、目标不变探索与自适应权衡。我们的实验表明,我们的机制对于基于策略的方法具有极高的样本效率,并将一个基于策略的基线在Arcade Learning Environment上提升至新的State-Of-The-Art。

关键词

引用

@article{arxiv.2106.00707,
  title  = {An Entropy Regularization Free Mechanism for Policy-based Reinforcement Learning},
  author = {Changnan Xiao and Haosen Shi and Jiajun Fan and Shihong Deng},
  journal= {arXiv preprint arXiv:2106.00707},
  year   = {2021}
}

备注

arXiv admin note: text overlap with arXiv:2105.03923