中文

用于无监督强化学习的惊喜混合策略

机器学习 2022-10-14 v1 人工智能

摘要

无监督强化学习旨在以无奖励的方式学习一个通用策略,以便快速适应下游任务。现有大多数方法提出基于惊喜提供内在奖励。最大化或最小化惊喜会驱动智能体去探索环境或对环境获得控制。然而,这两种策略都依赖于一个强假设:环境动态的熵要么高要么低。这一假设在现实场景中未必总成立,因为环境动态的熵可能未知。因此,在这两个目标之间做选择是一个两难问题。我们提出一种新颖而简单的策略混合方法来解决该问题,使我们能够优化一个同时最大化和最小化惊喜的目标。具体而言,我们训练一个以最大化惊喜为目标的混合分量,以及另一个以最小化惊喜为目标的混合分量。因此,我们的方法不对环境动态的熵做假设。我们将该方法称为用于无监督强化学习的惊喜混合(Mixture Of Surprises,MOSS)。实验结果表明,我们这种简单的方法在 URLB 基准上达到了最先进的性能,优于先前纯基于惊喜最大化的目标。我们的代码可在 https://github.com/LeapLabTHU/MOSS 获取。

关键词

引用

@article{arxiv.2210.06702,
  title  = {A Mixture of Surprises for Unsupervised Reinforcement Learning},
  author = {Andrew Zhao and Matthieu Gaetan Lin and Yangguang Li and Yong-Jin Liu and Gao Huang},
  journal= {arXiv preprint arXiv:2210.06702},
  year   = {2022}
}

备注

Accepted to NeurIPS 2022