中文

基于自监督预测的好奇心驱动探索

机器学习 2017-05-16 v1 人工智能 计算机视觉与模式识别 机器人学 机器学习

摘要

在许多现实场景中,作用于智能体外部的奖励极其稀疏,或完全缺失。在此类情况下,好奇心可作为内在奖励信号,使智能体探索其环境并学习可能在其后续生命中有用的技能。我们将好奇心公式化为智能体在由自监督逆动力学模型学习的视觉特征空间中预测自身行为后果的能力的误差。我们的公式可扩展到诸如图像的高维连续状态空间,绕过了直接预测像素的困难,并且关键的是,忽略了环境中那些不能影响智能体的方面。所提出的方法在两个环境中进行评估:VizDoom和Super Mario Bros。研究了三种广泛设置:1)稀疏外部奖励,其中好奇心允许少得多的与环境交互即可达到目标;2)无外部奖励的探索,其中好奇心推动智能体更高效地探索;3)对未见场景(例如同一游戏的新关卡)的泛化,其中从先前经验获得的知识帮助智能体比从零开始更快地探索新地方。演示视频和代码见 https://pathak22.github.io/noreward-rl/

关键词

引用

@article{arxiv.1705.05363,
  title  = {Curiosity-driven Exploration by Self-supervised Prediction},
  author = {Deepak Pathak and Pulkit Agrawal and Alexei A. Efros and Trevor Darrell},
  journal= {arXiv preprint arXiv:1705.05363},
  year   = {2017}
}

备注

In ICML 2017. Website at https://pathak22.github.io/noreward-rl/