中文

最大熵多样探索:解耦最大熵强化学习

机器学习 2019-11-05 v1 人工智能 机器学习

摘要

两条迄今脱节的研线——多样探索(DE)与最大熵强化学习——通过表面不同的机制解决了一系列强化学习算法面临的问题。本工作中,我们识别出这两种方法间的联系。首先,提出基于判别器的多样性目标并将其与常用散度度量相联系。随后我们将该目标扩展至最大熵框架,提出一种算法最大熵多样探索(MEDE),为学习多样行为提供了原则性方法。理论研究表明,MEDE 学到的策略集捕获了最优最大熵策略相同的模态。实际上,所提算法将最大熵策略解耦为其多样的组成策略。实验显示 MEDE 在学习高性能且多样的策略方面优于当前最优方法。

关键词

引用

@article{arxiv.1911.00828,
  title  = {Maximum Entropy Diverse Exploration: Disentangling Maximum Entropy Reinforcement Learning},
  author = {Andrew Cohen and Lei Yu and Xingye Qiao and Xiangrong Tong},
  journal= {arXiv preprint arXiv:1911.00828},
  year   = {2019}
}