中文

源于空白的行为:无监督主动预训练

机器学习 2021-10-29 v4

摘要

我们提出一种用于强化学习的新型无监督预训练方法APT,即主动预训练(Active Pre-Training)。APT通过在无奖励环境中主动搜索新颖状态来学习行为与表示。关键新颖思想是通过在抽象表示空间中最大化非参数熵来探索环境,这避免了具有挑战性的密度建模,从而使我们的方法在具有高维观测(例如图像观测)的环境中可更好地扩展。我们通过在长时间无监督预训练阶段后暴露任务特定奖励来对APT进行经验评估。在Atari游戏中,APT在12个游戏上达到人类水平性能,并与规范的完全监督RL算法相比获得高度竞争性的性能。在DMControl套件上,APT在渐近性能与数据效率方面击败所有基线,并极大地改进了从零开始训练极其困难的任务上的性能。

关键词

引用

@article{arxiv.2103.04551,
  title  = {Behavior From the Void: Unsupervised Active Pre-Training},
  author = {Hao Liu and Pieter Abbeel},
  journal= {arXiv preprint arXiv:2103.04551},
  year   = {2021}
}

备注

Advances in Neural Information Processing Systems(NeurIPS), 2021 Spotlight