中文

Wasserstein 无监督强化学习

机器学习 2021-10-18 v1

摘要

无监督强化学习旨在训练智能体在没有外部奖励的环境中学习少量策略或技能。这些预训练的策略可以在赋予外部奖励时加速学习,也可以用作分层强化学习中的基本选项。传统的无监督技能发现方法向智能体输入一个潜变量,并通过互信息(MI)最大化来增强其对智能体行为的赋权。然而,基于 MI 的方法学习到的策略尽管可以成功相互区分,但无法充分探索状态空间。因此,我们提出了一个新的框架——Wasserstein 无监督强化学习(WURL),其中我们直接最大化不同策略诱导的状态分布之间的距离。此外,我们克服了同时训练 N(N>2)个策略以及将整体奖励分摊到每一步的困难。实验表明,我们的方法学到的策略在 Wasserstein 距离指标上优于基于 MI 的方法,同时保持了高可区分性。此外,通过 WURL 训练的智能体能够在迷宫和 MuJoCo 任务中充分探索状态空间,并且预训练的策略可以通过分层学习应用于下游任务。

关键词

引用

@article{arxiv.2110.07940,
  title  = {Wasserstein Unsupervised Reinforcement Learning},
  author = {Shuncheng He and Yuhang Jiang and Hongchang Zhang and Jianzhun Shao and Xiangyang Ji},
  journal= {arXiv preprint arXiv:2110.07940},
  year   = {2021}
}