中文

基于分歧的自监督探索

机器学习 2019-06-11 v1 人工智能 计算机视觉与模式识别 机器人学 机器学习

摘要

高效探索是感觉运动学习中的一个长期问题。在视频游戏和仿真等无噪声、非随机环境中已取得重大进展。然而,大多数此类形式化方法要么在具有随机动力学的环境中陷入困境,要么效率太低而无法扩展到真实机器人设置。在本文中,我们提出了一种受主动学习文献工作启发的探索形式化方法。具体而言,我们训练一组动力学模型集合,并激励智能体进行探索,使得这些集合的分歧最大化。这使得智能体能够以自监督的方式在没有外部奖励的情况下学习技能。值得注意的是,我们进一步利用分歧目标以可微分的方式优化智能体的策略,而不使用强化学习,从而实现样本高效的探索。我们在包括随机 Atari、Mujoco 和 Unity 在内的多种基准环境中证明了该形式化方法的有效性。最后,我们在真实机器人上实现了可微分探索,该机器人完全从零开始学习与环境中的物体交互。项目视频和代码见 https://pathak22.github.io/exploration-by-disagreement/

关键词

引用

@article{arxiv.1906.04161,
  title  = {Self-Supervised Exploration via Disagreement},
  author = {Deepak Pathak and Dhiraj Gandhi and Abhinav Gupta},
  journal= {arXiv preprint arXiv:1906.04161},
  year   = {2019}
}

备注

Accepted at ICML 2019. Website at https://pathak22.github.io/exploration-by-disagreement/