后见之明中的好奇心:随机环境下的内在探索
机器学习
2023-07-21 v2 机器学习
摘要
考虑在稀疏奖励或无奖励环境(如 Montezuma's Revenge)中的探索问题。在好奇心驱动范式下,智能体因其每个已实现结果与预测结果的差异程度而获得奖励。但使用预测误差作为内在动机在随机环境中是脆弱的,因为智能体可能被状态-动作空间中的高熵区域(如“噪声电视”)所困住。在本工作中,我们研究了一种源自世界结构因果模型的自然解决方案:我们的核心思想是学习未来的表征,精确捕捉每个结果中不可预测的方面——我们将其用作预测的额外输入,从而使得内在奖励仅反映世界动态中可预测的方面。首先,我们提出将此类后见表征纳入模型中,以将“噪声”与“新颖性”解耦,从而产生后见之明中的好奇心(Curiosity in Hindsight):一种简单且可扩展的好奇心泛化方法,对随机性具有鲁棒性。其次,我们以最近提出的 BYOL-Explore 算法为主要示例实例化该框架,得到抗噪声的 BYOL-Hindsight。第三,我们在网格世界中展示了其在多种不同随机性下的行为,并发现其在具有粘性动作(sticky actions)的困难探索 Atari 游戏中优于 BYOL-Explore。值得注意的是,我们在具有粘性动作的 Montezuma's Revenge 探索中展示了最先进的结果,同时在非粘性设置中保持了性能。
引用
@article{arxiv.2211.10515,
title = {Curiosity in Hindsight: Intrinsic Exploration in Stochastic Environments},
author = {Daniel Jarrett and Corentin Tallec and Florent Altché and Thomas Mesnard and Rémi Munos and Michal Valko},
journal= {arXiv preprint arXiv:2211.10515},
year = {2023}
}