通过构建平稳目标改进内在探索
机器学习
2024-04-24 v4 人工智能
摘要
强化学习中的探索奖励通过定义定制的内在目标来引导长程探索。若干探索目标如基于计数的奖励、伪计数和状态熵最大化都是非平稳的,因此难以被智能体优化。尽管该问题已被普遍认知,却常被忽略,相关解决方案仍待深入探索。我们工作的关键贡献在于通过增强状态表示将原始非平稳奖励转化为平稳奖励。为此,我们引入了用于探索的平稳目标(SOFE)框架。SOFE 需要识别不同探索奖励的充分统计量,并找到这些统计量的高效编码以作为深度网络的输入。SOFE 基于提出状态增强来扩展状态空间,但有望简化智能体目标的优化。我们展示了 SOFE 改进了若干探索目标的性能,包括基于计数的奖励、伪计数和状态熵最大化。此外,SOFE 优于先前试图稳定内在目标优化的方法。我们在困难探索问题中展示了 SOFE 的有效性,包括稀疏奖励任务、基于像素的观测、3D 导航和过程生成环境。
引用
@article{arxiv.2310.18144,
title = {Improving Intrinsic Exploration by Creating Stationary Objectives},
author = {Roger Creus Castanyer and Joshua Romoff and Glen Berseth},
journal= {arXiv preprint arXiv:2310.18144},
year = {2024}
}
备注
Accepted at ICLR 2024