超越想象:利用世界模型最大化片段可达性
机器学习
2023-08-29 v1
摘要
高效探索是强化学习中的一个具有挑战性的课题,尤其是对于稀疏奖励任务。为应对奖励稀疏性,人们通常施加内在奖励以激励智能体高效探索状态空间。本文提出一种称为GoBI(Go Beyond Imagination,超越想象)的新型内在奖励设计,它将传统的终身新颖性激励与旨在最大化逐步可达性扩展的片段内在奖励相结合。更具体地,我们应用习得的世界模型,通过随机动作生成预测的未来状态。那些在片段记忆中不存在、具有更多独特预测的状态被赋予高内在奖励。我们的方法在12个最具挑战性的Minigrid导航任务上大幅优于先前的最先进方法,并提升了DeepMind Control Suite中运动任务的样本效率。
引用
@article{arxiv.2308.13661,
title = {Go Beyond Imagination: Maximizing Episodic Reachability with World Models},
author = {Yao Fu and Run Peng and Honglak Lee},
journal= {arXiv preprint arXiv:2308.13661},
year = {2023}
}
备注
Published in the 40th International Conference on Machine Learning