用于内在动机探索的潜在世界模型
机器学习
2020-10-07 v1 人工智能
机器学习
摘要
本文研究具有稀疏奖励的部分可观测环境。我们提出一种针对基于图像的观测的自监督表示学习方法,该方法根据观测的时间距离来排列嵌入。该表示在经验上对随机性具有鲁棒性,并适用于通过预测前向模型的误差进行新颖性检测。我们考虑情景式与终身式不确定性以引导探索。我们提出利用在所学潜在空间中运行的世界模型来估计关于环境的缺失信息。作为该方法的动机,我们在表格型部分可观测迷宫中分析了探索问题。我们在 Atari 基准中基于图像的困难探索环境中演示了该方法,并报告了相对于先前工作的显著改进。该方法及所有实验的源代码可在 https://github.com/htdt/lwm 获取。
引用
@article{arxiv.2010.02302,
title = {Latent World Models For Intrinsically Motivated Exploration},
author = {Aleksandr Ermolov and Nicu Sebe},
journal= {arXiv preprint arXiv:2010.02302},
year = {2020}
}
备注
NeurIPS 2020 Spotlight; Code is publicly available at https://github.com/htdt/lwm