中文

监督自我:交互环境中自监督表示的考察

机器学习 2019-07-01 v1 计算机视觉与模式识别 机器学习

摘要

自监督方法中,智能体仅通过观察其动作的结果来学习表示,在不提供稠密奖励信号或标签的环境中变得至关重要。在大多数情况下,此类方法被用作“下游”任务(如控制、探索或模仿学习)的预训练或辅助任务。然而,尚不清楚哪种方法的表示最好地捕捉了环境的有意义特征,以及哪种最适合哪类环境。我们针对两个视觉环境:Flappy Bird 和 Sonic The Hedgehog,提出了自监督方法的小规模研究。特别地,我们在两种情境下定量评估从这些任务学到的表示:a) 表示捕捉智能体真实状态信息的程度;b) 这些表示对新情境(如新关卡和纹理)的泛化能力。最后,我们通过可视化这些自监督特征所关注的环境部分来评估它们。我们的结果表明,表示的效用高度依赖于环境的视觉与动态特性。

关键词

引用

@article{arxiv.1906.11951,
  title  = {Supervise Thyself: Examining Self-Supervised Representations in Interactive Environments},
  author = {Evan Racah and Christopher Pal},
  journal= {arXiv preprint arXiv:1906.11951},
  year   = {2019}
}

备注

Accepted to the 2019 ICML Workshop on Self-Supervised Learning