中文

通过乐观探索学习更多技能

机器学习 2022-05-13 v6 人工智能 机器学习

摘要

无监督技能学习目标(Gregor 等,2016;Eysenbach 等,2018)使智能体能够在缺乏外在奖励的情况下学习丰富的行为库。它们通过同时训练一个策略以产生可区分的潜变量条件轨迹,以及一个判别器通过尝试从轨迹推断潜变量来评估可区分性来工作。其期望是通过鼓励每个技能(潜变量)可靠地到达不同状态,使智能体探索并掌握环境。然而,一个固有的探索问题依然存在:当实际遇到新状态时,判别器必然没有看到足够的训练数据以产生准确且置信的技能分类,导致智能体的内在奖励较低,并实际上惩罚了真正最大化目标所需的那种探索。为对抗这种对探索的固有悲观情绪,我们推导了一个信息增益辅助目标,涉及训练一组判别器集成,并因它们的不一致而奖励策略。我们的目标直接估计了来自判别器未见过足够训练样本的的认知不确定性,从而与基于伪计数(pseudocount)的方法(Burda 等,2019)相比,提供了更贴合真实目标的内在奖励。我们将此探索奖励称为判别器不一致内在奖励,或 DISDAIN。我们通过实验证明,DISDAIN 在表格网格世界(Four Rooms)和 Atari Suite 的 57 个游戏(从像素)中均改善了技能学习。因此,我们鼓励研究者以 DISDAIN 对待悲观。

关键词

引用

@article{arxiv.2107.14226,
  title  = {Learning more skills through optimistic exploration},
  author = {DJ Strouse and Kate Baumli and David Warde-Farley and Vlad Mnih and Steven Hansen},
  journal= {arXiv preprint arXiv:2107.14226},
  year   = {2022}
}

备注

Accepted at ICLR 2022 (spotlight)