基于可达性的情景式好奇心
机器学习
2019-08-07 v5 人工智能
计算机视觉与模式识别
机器人学
机器学习
摘要
现实世界中的奖励是稀疏的,当今大多数强化学习算法都难以应对这种稀疏性。该问题的一个解决方案是让智能体为自己创造奖励——从而使奖励变得稠密且更适合学习。具体而言,受动物好奇行为的启发,观察到新奇事物可给予奖励加成。该加成与真实任务奖励相加——使强化学习算法能够从组合奖励中学习。我们提出了一种利用情景记忆形成新奇奖励加成的新好奇心方法。为确定该加成,将当前观测与记忆中的观测进行比较。关键在于,比较基于从记忆中的观测到达当前观测所需的环境步数——这融入了关于环境动态的丰富信息。这使我们能够克服已有工作的已知“沙发土豆”问题——即智能体找到一种通过利用导致难以预测后果的动作来即时满足自身的方式。我们在 ViZDoom、DMLab 和 MuJoCo 的视觉丰富 3D 环境中测试了我们的方法。在 ViZDoom 和 DMLab 的导航任务中,我们的智能体优于最先进的 ICM 好奇心方法。在 MuJoCo 中,配备我们好奇心模块的蚂蚁仅从第一人称视角好奇心学习到了运动能力。
引用
@article{arxiv.1810.02274,
title = {Episodic Curiosity through Reachability},
author = {Nikolay Savinov and Anton Raichuk and Raphaël Marinier and Damien Vincent and Marc Pollefeys and Timothy Lillicrap and Sylvain Gelly},
journal= {arXiv preprint arXiv:1810.02274},
year = {2019}
}
备注
Accepted to ICLR 2019. Code at https://github.com/google-research/episodic-curiosity/. Videos at https://sites.google.com/view/episodic-curiosity/