后继-前驱内在探索
机器学习
2024-01-26 v3
摘要
探索在强化学习中至关重要,尤其在外部奖励稀疏的环境中。我们在此关注基于内在奖励的探索,其中智能体用自生成的内在奖励临时增强外部奖励。尽管内在奖励研究历史悠久,现有方法侧重于基于状态未来前景度量来构造内在奖励,忽略了转移序列回顾结构中所包含的信息。本文认为,智能体可利用回顾信息生成具有结构意识的探索行为,基于全局而非局部信息促进高效探索。我们提出后继-前驱内在探索(SPIE),一种基于结合前瞻与回顾信息的新颖内在奖励的探索算法。我们表明,在具有稀疏奖励与瓶颈状态的环境中,SPIE 比对比方法产生更高效且更符合动物行为学的探索行为。我们还将 SPIE 实现于深度强化学习智能体中,并表明所得智能体在稀疏奖励 Atari 游戏上取得了比现有方法更强的经验性能。
引用
@article{arxiv.2305.15277,
title = {Successor-Predecessor Intrinsic Exploration},
author = {Changmin Yu and Neil Burgess and Maneesh Sahani and Samuel J. Gershman},
journal= {arXiv preprint arXiv:2305.15277},
year = {2024}
}